【刷榜还是进化?Anthropic新模型ARC-AGI跑分疑云】Anthropic最新的Opus 5在ARC-AGI-3基准测试中跑出了惊人的高分,远超此前所有模型,甚至在某些维度上表现得像个“老手”。然而,这种跨越式的进步引发了圈内对其“刷榜”(Benchmaxxing)的强烈质疑:在面对经典谜题时,Opus 5能不假思索地给出字节级一致的最优解;但在面对规则稍作修改的新题时,表现甚至不如旧版本。这种“背题家”式的表现,揭开了大模型行业一个公开的秘密:为了那几亿美金的估值和市场地位,实验室们正陷入一种病态的刷榜竞争。这不仅是数据污染的问题,更像是一种“脚手架内化”训练——模型并没有真正习得通用推理能力,只是学会了特定题型的套路。如果你发现新模型在处理日常工作时依然会犯低级错误,但在复杂谜题上却像个天才,那大概率是因为它在训练集里见过“参考答案”。真正的AGI不该是靠记忆力取胜的考试机器,而应是在陌生环境下解决新问题的能力。当跑分变成一场涂抹口红的选美比赛,我们更需要关注那些模型在“没见过”的场景下,是否还能像人类一样思考。 news.ycombinator.com/item?id=49045040
发布于 北京
