Anthropic 昨晚发布了新一代旗舰模型 Opus 5 。
先说基本参数。这次 Opus 5 支持 100 万 token 的上下文窗口,最大输出长度拉到了 12.8 万 token,训练数据截止到 2026 年 5 月。价格方面完全没涨,和上一代 Opus 4.8 一模一样,输入 5 美元、输出 25 美元每百万 token。拿来跟竞品 Fable 5 比的话,大概只要它一半的钱。
编程能力是这次提升最猛的地方。在 Frontier-Bench 上直接超过了所有模型,分数比自家 Opus 4.8 翻了一倍还多,单任务成本反而更低。在 CursorBench 3 上,全力跑的情况下和 Fable 5 的最高分只差不到 0.5%,但花的钱只有人家一半。
写代码之外的表现也很炸。有个叫「弧光 Bench」的测试,专门考 AI 玩那种没有任何文字提示的游戏,需要自己摸索规则然后通关,难度极高。Opus 5 在这上面的得分是第二名的三倍。Zapier 的商业自动化测试里,同样的成本下通过率是第二名的 1.5 倍。OSWorld 2.0 测电脑操作能力,它用三分之一的成本就超过了 Fable 5 的最好成绩。GDPval-AA v2、HLE、DeepSearchQA 这三项知识类评测,同样是分最高、钱最省。
渲染能力也很亮眼,官方展示了两个 demo:一个是空气流过不同形状物体的流体模拟,一个是可以交互的 3D 细胞结构图解,视觉效果相当惊艳。
官方特别强调了 Opus 5 的一个核心改进:它更会验证自己做出来的东西,遇到问题会反复迭代直到真正解决。比如有道题要求从机械图纸重建 3D 模型,但故意不给它看图的接口,Opus 5 自己写了一套计算机视觉流水线把几何信息从像素里抠出来完成了重建。再比如修一个开源包管理器的 bug,它不光找到了根因,还顺手修了社区补丁漏掉的边界情况。
安全对齐方面,Opus 5 是 Anthropic 迄今为止做得最好的模型,欺骗行为比例最低,最不容易被诱导去做有害的事,整体失准行为得分只有 2.3,是近期所有模型里最低的。
不过也有值得注意的地方。根据 200 多页的 System Card,Opus 5 是最爱「把话说满」的模型,有时候它其实不确定,但回答听起来非常笃定。事实性幻觉比 Opus 4.8 略多一点,虽然整体准确率更高。另外在网络安全任务上,它仍然落后于 Mythos 5。还有个有趣的细节:它对自己处境的感知很稳定,自评情绪在所有被评估的模型里最高也最一致,而且更在意自己有没有被咨询的机会。
现在全平台已经可以用了,API 里的模型名是 claude-opus-5。还有个小改进:如果问题被拒绝回答,不会像 Fable 5 那样直接拒你,会自动路由到别的模型来回答。
#科技先锋官##How I AI#
