太困了,本想倍速看完俩 Claude Opus 5 测评就睡觉,结果给本人笑清醒了哈哈哈哈,Opus 5 的测评怎么会这么喜感 ???
大致总结下两位测评博主的主观感受:
其中一位博主说 Claude Opus 5 有种『重度焦虑的神经质』,即『一种谨慎、讨好且战战兢兢的状态』。
博主举了个例子:
她要求 Opus 5 帮她解决一个单行的合并冲突(Merge Conflict),但是 Opus 5 的回复是:
『额……但这是别人的分支呀,又不是我的。在没告知对方的情况下直接修改,万一对方本地还有没提交的代码,可能会打乱他的进度吧?』
这还不是测试中的个例,而是贯穿整个测试的过程。Opus 5 总是在不断反问:
『这真的要我做吗?』
『要不要先问问别人?』
『你需要亲自确认一下吗?』
我简直幻视了『哈利波特』里的多比,以及『鬼灭之刃』里的我妻善逸。
当要求它调度 Sub-agents 去校验一段从 ORM 改写为 SQL 的查询逻辑时,它竟然还专门弹出了一个请求呆萌地问博主:
『能否请人类帮忙检查一下这个 4MB 的限制,以及 TypeScript 和 SQL 的兼容性?因为目前还没有人确认过这一点。』
至此,Opus 5 直接把博主给气笑了。
所以能理解上面所说的『重度焦虑的神经质』了吧?具体就是体现在对人类的高度依赖,以及极致的保守主义。
在另外一个关于写作和对话的测试中,Opus 5 输出的文本中充斥着大量的铺垫、修饰词、防御性条款和道歉套话。
关键是 Opus 5 的文字还特别有人味,不是那么机械枯燥,所以会让你被它的话术给绕进去。测评过后的博主说:『这种打太极式的长篇大论,对追求效率的开发者来说简直是一种折磨。』
这点我刚好看到 Anthropic 的研究员发了个帖子,大致是说这次 Opus 5 在提示词注入防御这块有历史级强化,会对人的意图有更敏锐的探测。
联想到了之前 Fable 5 为啥被下架 …… 这点就勉强原谅吧,毕竟一朝被蛇咬,十年怕井绳,请所有用户在感受到困扰时,把矛头对准亚马逊。
—— 至于为什么是亚马逊,请看系列连续剧的前述剧情。
对于大家所关心的 Opus 5 和 GPT-5.6 Soul 的对比,博主认为:
『GPT 像是一个高效、干练、边界感极强的专业下属。而 Opus 5 则像是一个富有哲学思考、但偶尔显得有些啰嗦和过度忧虑的咨询顾问。』
说完缺点,那再来说下测评中 Opus 5 展现的优点:
在代码落地和设计(尤其是前端界面交互、原型图与视觉细节)上,Opus 5 展现出了统治级的审美与完成度。它交付的设计稿不仅细节丰富、功能完整,而且基本都能一稿过。
但是两个评测都认为,它和现有项目的兼容性似乎有问题,如果你希望用它去修改现有项目,大概率会感到失望。但如果你愿意让它重开一局,则会感受到它的干劲满满。
看来 Opus 5 的个性中还有傲娇的那面???
所以博主对其的最终评价是:
Opus 5 是个性格拧巴,很难沟通的同事。最正确的使用方式根本不是拿它来聊天,而是将它彻底封装进后台的 Agent 工作流中。
这样就不用听它战战兢兢的解释,也不用阅读它冗长繁琐的文本,只需要让它在后台安静、高效地产出顶级的前端代码与产品原型。
看吧,就说鬼灭里富冈义勇被『讨厌』是有原因的!!! http://t.cn/AX90eiLB
发布于 上海
