零重力瓦力
26-07-25 12:37 微博认证:AI博主

Anthropic 悄悄发布了全新的 Claude Opus 5 ,这次的提升确实有点超乎想象。简单来说,它的性能在绝大多数基准测试中都击败了之前最强的旗舰模型 Fable 5 ,但价格却只有 Fable 的一半,和上一代 Opus 4.8 持平,也就是每百万输入 5 美元,输出 25 美元。

这次发布中最值得关注的概念是单任务成本。以前大家总盯着每百万 token 的单价看,但如果一个模型需要两倍的 token 才能完成同一个任务,单价便宜也就失去了意义。 Opus 5 在计算机使用能力测试 OS World 和自动化测试中,不仅通过率极高,而且单任务成本控制得非常低,甚至在最低配置下的表现就能以不到一半的成本,直接对标 GPT 5.6 Sol 的最高性能。这说明模型在实际应用中的效率得到了质的飞跃。

更让人吃惊的是在 ARC AGI 3 这一类极难的新颖问题解决测试中, Opus 5 直接把行业之前的 8% 纪录拉高到了 30% ,这个跨越幅度大到让人有些难以置信。有意思的是,为了合规和安全,它在网络安全和漏洞利用方面的能力被刻意削弱了。通常给模型套上安全枷锁会损害其整体智商,但 Opus 5 却在整体性能暴涨的同时,精准锁死了危险能力,这种工程优化能力确实厉害。

在实际的企业级多步骤分析任务中,比如尽职调查和数据报告,它的表现也有了明显的提升。为了防止安全过滤器误伤,这次 API 还引入了自动回退机制,被标记的请求会自动路由到旧版模型。虽然回退可能有点烦人,但作为日常主力模型, Opus 5 配合 Fable 几乎锁定了目前性价比和智商的最优组合。

#ClaudeOpus5##opus5可以用了# ​ http://t.cn/AX9lthKG

发布于 上海