昨天 Anthropic 发布了他们的主力模型 Claude Sonnet 4.6,很多基准测试甚至超过了 Opus 4.6。那么,我们该如何选择?AI 科技博主 Matthew Berman 对 Sonnet 4.6 进行了详细分析。
先说说 Sonnet 4.6 这次升级了什么?
编程能力有提升,但不是最大的亮点。主要的亮点在两方面,计算机操控,从 61% 涨到 72.5%。工具调用,从 43.8 直接跳到 61.3。两者提升幅度都不小,说明 Sonnet 这次升级的方向聚焦于实用性。
所谓计算机操控,就是模型可以像人一样操作一台真实的电脑,包括移动鼠标、敲键盘、看屏幕、做判断,不需要特殊接口。这在 OSWorld 基准测试上有直接体现,Sonnet 4.6 的得分比 4.5 高了将近 12%。
工具调用的提升对实际使用影响更大。当模型能稳定地调用外部工具、连接 MCP 服务器的时候,它能做的事情就从简单的回答问题变成了执行各种任务。
自动售货机基准测试是目前最考验模型综合能力的测试。它把模型扔进一个模拟环境里,让它自主管理一台售货机的库存和定价,目标是最大化利润。Sonnet 4.5 跑了 350 天,最终收入大约 2000 美元,Sonnet 4.6 则跑到了 5500 美元左右。而且它会在前期优先扩大产能,后期转向盈利优化,具有策略性。这不像是随机跑出来的结果,更像是某种有意识的节奏安排。当然这只是模拟,但确实说明模型在长程规划上有了变化。
还有一个考验模型抽象推理能力的 ARC-AGI-2 测试,Sonnet 4.5 得了 13.6 分,Sonnet 4.6 直接跳到 58.3。这个幅度已经不能算是 "小步迭代" 了。
在金融分析和办公任务上,Sonnet 4.6 的得分甚至超过了 Opus 4.6,这是最让人意外的地方。Anthropic 明显是把模型往 "知识工作者的日常工具" 方向进行了优化,不只是跑分,而是真实工作场景下的表现。
安全这边,Anthropic 把 Sonnet 4.6 评定为 ASL-3 级,意思是它已经超出了早期危险能力的范围,但还没到可以 "实质性地协助开发生化武器" 的程度。不过模型卡里有一句话颇耐人寻味。他们说,要自信地排除某些高危能力门槛,正变得越来越困难,因为模型的能力在逼近甚至超越他们预设的某些评估节点,连测量方式本身都需要更新了。这不是危言耸听,但至少说明模型能力仍在不断加速,很多方面甚至超出了开发者的预期。
Sonnet 4.6 的定价和 4.5 一样,每百万输入 Token 3 美元,输出 15 美元。现在已经成为了 Claude 免费版默认模型。
至于命名问题,有不少人猜测 Anthropic 原本是在训练 Sonnet 5 甚至 Opus 5,后来改了个名字推出来。内情不得而知,但 Sonnet 和 Opus 之间的边界确实越来越模糊了。
#claude[超话]##AI创造营# http://t.cn/AXtmaGKu
发布于 上海
