互联网的那点事
25-04-02 16:19 微博认证:微博互联网观察家

字节跳动最新研究:大模型在大部分情况下只是“复读机

并非真正拥有推理能力

只是在复述学习过的答案

核心发现:

几乎所有知名AI模型(ChatGPT、Claude、Gemini、DeepSeek等)在改动后的题目上表现一塌糊涂。

本来答对率有80%,一改就掉到20%多,甚至更低。

模型常常“不看清题目”,还是用老套路答题。

这些模型实际上是**“复述训练中见过的解题模板”,而非基于输入条件真正进行语义理解与逻辑推理**。

例如:

问题改了一个词(如将“相向而行”改为“相背而行”),模型仍套用原来的解法,导致错误回答。

在“无解问题”中,绝大多数模型强行生成错误答案,无法识别问题本身不可解。

他们试过很多办法让AI“别套模板”:

加提示语:“请严格看题”

给几个类似例子做参考

强行告诉它:“题目没有错,按字面理解”

让AI思考得更“长一点”(Chain of Thought)

📉 结果:都只能小幅提升,效果仍然不理想!

详细解读:http://t.cn/A6r4r5Kt
原始论文:http://t.cn/A6r4r5Kc

发布于 安徽