Mun logadan这篇文章今天在Hacker News上引发很多人共鸣。更好的模型,不一定更好用~
----------------
为什么 Opus 5 用起来反而更差了?
在我看来,以及和我交流过的同事看来,和 Opus 5 一起工作,相比 Opus 4.7、Opus 4.8 和 Fable,感觉反而像是一次倒退。
我并不是说它的能力退步了——Opus 5 的能力确实比 Opus 4.7 和 Opus 4.8 更强,甚至在基准测试中也能与 Fable 媲美。但实际用起来,其他这些模型却让人感觉更舒服。我认为原因在于,它们会:
· 如果我的意图不清楚,就停下来提问;
· 不会在未经确认的情况下自行做假设;
· 不会不经询问就擅自重新解释或修改我的计划。
正因为如此,使用这些模型时,不需要像使用 Opus 5 那样小心翼翼地全程盯着它。
🌟毫无根据的猜测
我怀疑,这是 Anthropic,以及当前整个前沿 AI 实验室领域中,两股力量叠加作用的结果。
第一,是打造一种能够不断自我改进、通过递归式自举最终迈向 AGI / ASI 的 AI 的愿望。
第二,是在各种基准测试中取得高分的压力。虽然大家心照不宣的是,很多基准测试任务本身定义模糊、不公平、可以投机取巧,或者干脆就是有问题的,但一个好的基准测试任务应该是自包含的:它应该是可以被解决的。你不需要额外提示,不需要猜出题人的心思,也不需要借助外部信息才能通过。
这并不意味着一个好的任务只能有唯一正确答案,而是说,所有明确无误的正确答案,都应该获得同等的评分。
当我们筛选那些在基准测试中表现优秀的模型时——实际上,无论是专门针对基准测试训练,还是更广泛地使用 RLVR(基于可验证奖励的强化学习)任务进行训练——本质上都会倾向于筛选出这样一类模型:面对模糊情况时,它们敢于大胆做出假设,而且这些假设通常是对的。
相应地,那些更倾向于停下来询问澄清信息或进一步指示的模型,反而会因此受到惩罚。
遗憾的是,这恰恰是我们大多数人希望一个编程智能体具备的行为。
无论你多么努力,几乎都不可能把全部上下文、真实意图、业务影响、预算限制以及诸如此类的所有信息,全都写下来,并确保一个编程智能体能够访问到这些内容。实际工作中不可避免地会存在模糊之处,也总会有需要做选择的地方。这个时候,如果你知道智能体会在必要时停下来问你,那其实是一件很让人安心的事。
现实生活终究不是基准测试。
现实中的每个问题,并不一定都有一个保证正确的答案,甚至未必存在一组所谓的“正确答案”。而当现实后果真正摆在眼前时,我可不希望一个智能体只是凭着自己的最佳猜测擅自做决定。
#How I AI#
