字节跳动最新研究:大模型在大部分情况下只是“复读机
并非真正拥有推理能力
只是在复述学习过的答案
核心发现:
几乎所有知名AI模型(ChatGPT、Claude、Gemini、DeepSeek等)在改动后的题目上表现一塌糊涂。
本来答对率有80%,一改就掉到20%多,甚至更低。
模型常常“不看清题目”,还是用老套路答题。
这些模型实际上是**“复述训练中见过的解题模板”,而非基于输入条件真正进行语义理解与逻辑推理**。
例如:
问题改了一个词(如将“相向而行”改为“相背而行”),模型仍套用原来的解法,导致错误回答。
在“无解问题”中,绝大多数模型强行生成错误答案,无法识别问题本身不可解。
他们试过很多办法让AI“别套模板”:
加提示语:“请严格看题”
给几个类似例子做参考
强行告诉它:“题目没有错,按字面理解”
让AI思考得更“长一点”(Chain of Thought)
📉 结果:都只能小幅提升,效果仍然不理想!
详细解读:http://t.cn/A6r4r5Kt
原始论文:http://t.cn/A6r4r5Kc
发布于 安徽
