Anthropic 今天凌晨发了个新模型,叫 Claude Sonnet 5.5,是 5.5 系列的第二个。一句话概括:便宜一半,快了三成,能力几乎追上了自家最强的 Opus 5.5。
先说价格。Sonnet 5.5 和上一代 Sonnet 5 完全一样,每百万 token 输入 2 美元、输出 10 美元,刚好是 Opus 5.5 的一半。而且干同样的活,它用的 token 更少,实际花的钱还能再低一截。
再说速度。官方测下来比 Sonnet 5 快了 30% 以上。他们让两个模型用同一句提示词各写一个网页动画,Sonnet 5.5 写完的时候画面里鸟群都飞了好一阵了,Sonnet 5 还在吭哧吭哧输出代码。
然后是大家最关心的能力。
编程这块,跑了好几个主流测试。Terminal-Bench 上,Sonnet 5.5 用中等思考档位,就远超 Sonnet 5 各档位的最好成绩,单次成本大概只有十分之一。档位拉满以后,分数甚至越过了 Opus 5.5,拿到 70.6%。FrontierCode 测的是代码改动能不能直接合入,High 档位比 Sonnet 5 高了 10 个百分点,成本只有十五分之一。CursorBench 拿到 55.5%,跟 Opus 5.5 的 57.8% 就差两个多点。
有个挺有意思的细节:FrontierCode 上开到 Max 档位,分数反而比 Xhigh 低了,因为它开始把代码审查拆给一堆子 Agent 去做,有的超时了,有的改动超出了任务范围。想太多,反而搞砸了。
知识工作方面,跟 Opus 5.5 几乎打平,比 Sonnet 5 高了大约 400 分。还有个明显的变化:它聊天更自然了,也更懂设计,会主动给界面多做一层打磨。Anthropic 自己做了个测试,把一家上市公司的财报和幻灯片模板丢给它,让它做 10 页经营回顾,两位专家看完觉得初稿可以直接发出去。
一批企业客户也给了数据。Epic Games 说它在系统设计审计上达到了更高档模型的质量。Base44 拿 118 个真实应用去测,每个应用的平均迭代次数从 7.7 次降到了 3.6 次。Unity 的多步骤测试里完成了 90% 的任务。Slack 不改任何提示词,结果几乎全部优于 Sonnet 5,输出 token 少了 14%。Zendesk 工单处理快了 20%。最夸张的是 Balyasny,跑了两千多个金融任务,每个回答的 token 用量从 49.7 万降到 12.1 万,不到原来的四分之一。
官方给的定位很明确:Opus 5.5 去啃那些需要持续判断的复杂大活,Sonnet 5.5 负责边界清楚的日常任务,修 bug、写文档、做幻灯片这些。另外这也是第一个加了网络安全防护的 Sonnet,日常开发不受影响,高风险操作会自动交给 Sonnet 5 处理。
目前已经在所有平台上线,AWS、Google Cloud、Azure 都有,API 名是 claude-sonnet-5-5。面向大批量场景的 Haiku 5.5 还在路上,预计几周内推出。
#科技先锋官##How I AI#
