德里克文
26-07-25 16:14 微博认证:AINEXT 联合创始人 AI博主

#ClaudeOpus5发布# Anthropic今天凌晨正式发布了Claude Opus 5,这次的关键词是:加量不加价。
Claude Opus 5 发布了,我先说结论:技术上值得尊敬,但 Anthropic 的定价策略暴露了焦虑。

几个关键数字:

1. 性能反超自家旗舰,但官方不承认。
Frontier-Bench 编程测试:Opus 5 拿 43.3%,Fable 5 只有 33.7%。OSWorld 电脑操作、AutomationBench 商业流程、Humanity's Last Exam——全赢。然后 Anthropic 官方博客的措辞是"接近 Fable 5 的智能"。一个在大多数考场分数更高的学生,被定性为"接近"那个分数更低的。这不是话术失误,是产品线定价不能乱。

2. ARC-AGI 3 从 1.5% 跳到 30.2%。
这是 François Chollet 设计的"流体智能"测试,模型没见过题、没指令、没规则,全靠自己摸索。Opus 4.8 是 1.5%,GPT-5.6 Sol 是 7.8%,Opus 5 直接 30.2%。这个数字让整个 AI 研究圈停了滚动。不管你喜不喜欢 Anthropic,这个进步是真实的。

3. 价格不变,性能翻倍。
输入 $5/百万 token,输出 $25,和 Opus 4.8 一模一样。但 Frontier-Bench 从 21.1%→43.3%,ARC-AGI 3 从 1.5%→30.2%。Anthropic 没涨价,因为它知道涨价就没人买了——中国开源模型在压价,Kimi K3 在压价,GPT-5.6 在压价。这不是大方,是被迫。

4. 把智能打折卖,把危险上锁。
Opus 5 在漏洞"发现"上接近 Mythos 5,但在漏洞"利用"上被刻意留在后面。安全分类器拦截频率比 Fable 5 少了 85%,但二进制漏洞扫描、渗透测试仍然封死。逻辑很清楚:防守放开,进攻锁死。这是 Anthropic 一贯的安全牌。

5. 发布当天就翻车。
官方对比图里,FrontierCode 那一行把 Opus 5 的 53.4% 加粗高亮成最优——旁边明明写着 53.5%。AI 做的图,AI 自己翻的车。全球网友先帮着"核对"了一遍。

我的看法:

Opus 5 是一款好模型,ARC-AGI 3 的 30.2% 是真正的里程碑。但 Anthropic 的策略问题没变:产品线叠床架屋(Haiku→Sonnet→Opus→Fable→Mythos,五层),定价逻辑靠"官方定性"而不是"实测性能"来维持,Fable 5 发布不到两个月就被自家兄弟架在火上烤。

更根本的问题是:当"次旗舰"在大多数测试里赢了"旗舰",你告诉我旗舰还是旗舰,是因为它更贵,还是因为它更安全?

我对 Anthropic 的产品策略持保留态度——不是因为技术不行,而是因为"把能力拆开卖、用安全当定价锚"这套逻辑,长远看不可持续。当开源模型追上来、GPT 系列持续迭代,用户会用脚投票。

#AI大模型##科技新动态##微博AI创作季#

发布于 福建