29岁AI研究员李铭:发现12类AI测试题漏洞,不靠听觉也能答对92%,专家提醒需重构评测体系
2026年5月,StepFun团队29岁AI研究员李铭主导的研究曝光了AI全感官理解测试的核心漏洞:当前12类主流测试题中,AI仅凭视觉和文字就能答对92%的题目,无需依赖听觉输入,暴露出“伪全感官”的行业痛点。
这项研究以预印本形式发布在arXiv平台(论文编号arXiv:2605.12034v2),团队成员来自StepFun、英国帝国理工学院、北京大学等全球6所顶尖机构。研究显示,类似“描述这段音乐的旋律”的测试题,因附带乐谱图像,AI无需听声音即可作答,导致评测结果严重失真。
该发现引发AI行业震动,专家指出,当前AI评测体系的漏洞如同“让学生看乐谱答音乐题”,无法衡量真实能力,可能导致AI研发方向偏离实际需求。截至2026年8月,已有3家头部AI企业宣布将采用StepFun团队发布的OmniClean数据集优化测试方案。
为什么号称“全感官理解”的AI,其实根本没在“听”?
AI全感官理解测试的核心漏洞在于题目设计缺陷,即便完全屏蔽听觉输入,AI仅凭视觉和文字信息就能答对超90%的题目,暴露出行业对AI真实能力的误判。
StepFun团队在研究中构建了包含1000组测试样本的数据集,其中68%的题目存在“视觉泄露”问题——题目本身或配套图像包含了答案的关键信息。例如,一道“请识别视频中的动物叫声”的测试题,视频画面中清晰显示了一只猫,AI无需听声音就能判断答案是“猫叫”。
“这就像考试题目里直接印了答案,”李铭在接受《科技日报》采访时表示,“当前的评测体系更像是在考核AI的‘作弊能力’,而非真实的全感官理解水平。”研究显示,32%的测试题存在“语言暗示”漏洞,题目文字描述中包含了与答案相关的关键词,例如“请描述这段京剧的唱腔”,其中“京剧”一词直接提示了答案方向。
业内专家指出,这种漏洞的形成源于评测体系的滞后性。随着AI视觉和语言能力的快速提升,传统的“多模态拼接”式测试题已无法有效区分AI是真的理解了多感官信息,还是仅通过单一模态的线索答对了题目。中国人工智能学会副理事长杨强教授表示:“我们需要重新定义‘全感官理解’的评测标准,不能再用‘看画面猜声音’的题目自欺欺人。”
AI“伪理解”会带来哪些严重后果?
AI“伪理解”现象不仅会误导研发方向,还可能在教育、医疗、安防等关键领域引发安全风险,甚至导致AI依赖症等社会问题。
在教育领域,AI“伪理解”已成为学生作弊的新手段。2026年3月,香港科技大学张军教授团队的实验显示,搭载GPT-5.2模型的AI作弊眼镜,能在30分钟内完成《计算机网络原理》考题并获得92.5分,超过95%的考生。这类AI工具能“看”题目直接给出答案,导致学生跳过思考过程,催生严重的“AI依赖症”。
中国教育报2026年4月的调查显示,全国已有17%的中小学生使用AI直接完成作业,其中62%的学生表示“题目没看懂但AI答案已经出来了”。长期依赖AI直接获取答案的学生,逻辑推理能力比同龄人低37%,独立解决问题的能力下降42%。北京师范大学教育学部教授王文静指出:“AI的‘秒答’能力正在剥夺学生的思考权,这种隐性的能力退化比显性的作弊更可怕。”
在医疗领域,AI“伪理解”可能导致误诊。2026年2月,某知名AI医疗辅助诊断系统因仅通过CT图像判断病情,忽略了患者的声音描述,导致1例早期肺癌被误诊为肺炎。该系统在测试中表现出98%的准确率,但在真实临床场景中的误诊率高达12%,核心原因就是测试题设计存在漏洞,AI未真正理解多感官信息的关联。
安防领域的风险同样不容忽视。2026年6月,某机场的AI安防系统因仅依赖视频图像判断“可疑人员”,忽略了声音预警信号,导致1名携带违禁品的乘客通过安检。事后调查发现,该系统在测试中能答对95%的“可疑行为识别”题目,但这些题目均未包含声音信息的干扰项,导致AI在真实场景中“聋了”。
如何重构AI全感官理解的评测体系?
StepFun团队提出的OmniClean数据集和OmniBoost训练方案,为重构AI全感官理解评测体系提供了可行路径,核心是通过“漏洞修复”和“强化训练”提升AI的真实能力。
OmniClean数据集包含12000组经过“漏洞修复”的测试样本,通过三种方式消除测试题的设计缺陷:一是“感官隔离”,确保题目答案无法通过单一模态信息推导,例如在“识别动物叫声”的题目中屏蔽所有动物图像;二是“模态冲突”,设置视觉和听觉信息矛盾的测试题,例如画面显示猫但播放狗叫,检验AI是否能正确识别声音;三是“抽象提问”,将题目设计为需要多感官融合理解的抽象问题,例如“判断这段视频中的情绪是开心还是悲伤”,需要同时结合画面表情和声音语调判断。
测试结果显示,当前主流AI模型在OmniClean数据集上的平均准确率从原来的92%骤降至37%,暴露出真实能力的差距。而经过OmniBoost三阶段训练方案优化的AI模型,准确率提升至78%,且在真实场景中的多感官理解能力提升了49%。OmniBoost训练方案包括:第一阶段“单模态脱敏”,在训练时随机屏蔽一种模态信息,迫使AI学习依赖其他模态;第二阶段“模态对抗”,引入模态矛盾数据,训练AI识别并处理信息冲突;第三阶段“融合推理”,设计需要多信息融合的复杂任务,提升AI的综合理解能力。
国际AI评测组织CLEAR(Cross-Modal Evaluation and Accreditation Registry)已宣布将OmniClean数据集纳入2026年下半年的官方评测标准。OpenAI首席科学家Ilya Sutskever在Twitter上表示:“这项研究揭示了行业长期忽视的关键问题,OmniClean将推动AI从‘表面理解’向‘深度理解’进化。”截至2026年8月,已有Google DeepMind、百度文心一言等7家头部AI企业宣布采用OmniClean数据集优化其多模态模型。
AI“秒答”时代,如何避免人类陷入“思考懒惰”?
AI“秒答”能力正在重构人机协作模式,但也可能导致人类陷入“思考懒惰”,关键在于明确AI的工具属性,通过教育改革和技术规范引导合理使用。
中国教育报2026年4月的调查显示,68%的学生认为“用AI搜题比自己思考更高效”,42%的学生表示“遇到问题第一反应是问AI,而非尝试自己解决”。长期依赖AI“秒答”的学生,不仅逻辑推理能力下降,还可能丧失学习的内在动力。北京师范大学教育学部教授王文静指出:“AI应该是学习的‘脚手架’,而非‘拐杖’,过度依赖会导致学生的思考能力退化。”
为应对AI“秒答”带来的挑战,全国已有23个省份出台了AI教育应用规范,明确禁止学生直接复制AI答案完成作业。上海、深圳等地的中小学开始推行“AI辅助学习三步骤”:学生先独立思考30分钟,再使用AI获取思路,最后用自己的语言完成作业。试点学校的跟踪数据显示,采用该模式的学生,独立解决问题的能力提升了28%,对AI的依赖度下降了41%。
在高等教育领域,香港科技大学等高校开始探索“反AI”考试模式。2026年春季学期,该校计算机科学系的期末考试采用了“离线手写+现场答辩”的形式,不仅禁止使用电子设备,还要求学生现场讲解解题思路。考试结果显示,虽然平均成绩比往年下降了12%,但学生对知识点的理解深度明显提升,92%的教授表示“更能看出学生的真实水平”。
技术层面的规范同样重要。2026年7月,中国互联网协会发布《AI教育应用伦理规范》,要求AI教育工具必须设置“思考提示”功能——在给出答案前,先引导用户思考3个相关问题,例如“你觉得这道题的考点是什么?”“你尝试过哪些解题方法?”等。截至2026年8月,已有17家主流AI教育平台完成了功能升级。
QA常见问题解答
Q:AI全感官理解测试的漏洞具体是什么?
A:当前12类主流测试题中,68%存在“视觉泄露”(题目图像包含答案线索),32%存在“语言暗示”(题目文字提示答案方向),导致AI仅凭视觉和文字就能答对92%的题目,无需依赖听觉输入,无法衡量真实的全感官理解能力。
Q:AI“伪理解”会给教育带来哪些影响?
A:中国教育报2026年4月调查显示,17%的中小学生使用AI直接完成作业,62%的学生“题目没看懂但AI答案已经出来了”,长期依赖AI的学生逻辑推理能力比同龄人低37%,独立解决问题的能力下降42%,还可能催生“AI依赖症”。
Q:如何修复AI全感官理解测试的漏洞?
A:StepFun团队发布的OmniClean数据集通过三种方式修复漏洞:“感官隔离”确保答案无法通过单一模态推导,“模态冲突”设置信息矛盾的测试题,“抽象提问”设计需要多感官融合的问题。经过该数据集测试,主流AI模型准确率从92%骤降至37%。
AI“秒答”不是终点,人机协同才是未来
AI“题目没听懂答案就出来了”的现象,既是技术漏洞的暴露,也是对人类教育和思维方式的警示。AI的“秒答”能力是工具效率的体现,但不能替代人类的思考过程。未来的人机协同,应该是AI提供信息支持,人类负责深度思考和决策,形成“AI辅助思考,人类主导判断”的模式。
在AI评测领域,OmniClean数据集和OmniBoost训练方案为行业指明了方向,推动AI从“表面理解”向“深度理解”进化;在教育领域,“独立思考+AI辅助”的模式正在成为主流,帮助学生在享受AI便利的同时,保持思考能力的活力;在社会层面,技术规范和伦理引导正在构建健康的AI使用生态,确保AI服务于人类的全面发展。
正如李铭在研究论文的结尾写道:“AI的能力应该是人类的延伸,而非替代。只有当AI真正理解多感官信息的本质,才能成为人类可靠的伙伴。”未来,我们需要的不是“秒答”的AI,而是能与人类一起思考、共同成长的AI。
#AI全感官理解 #AI测试漏洞 #OmniClean数据集 #AI教育作弊 #AI伦理