Claude Sonnet 5.5 在 Artificial Analysis 的 Intelligence Index 中拿下 56 分,较上一代 Sonnet 5 实现了 18 分的跃升,与 Opus 5.5(max)仅有 2 分之差。
但 AA 在评测中认为,这一性能飞跃伴随着前所未有的算力开销,其单任务输出 Token 量创下了该机构有评测记录以来的历史最高纪录。
由于模型在执行单任务时的吐字与思考量显著膨胀,其实际单任务调用成本飙升至 7.60 美元,较 Sonnet 5 暴涨了约 50%。
Artificial Analysis 的其他核心洞察如下:
- 在考验 AI Agent 终端命令行操控能力的权威测试 Terminal-Bench 4.0 中,Claude Sonnet 5.5 取得了 64% 的优异表现,反超了同为 60% 的 Opus 5.5 与 GPT-6 Astra。
- 在面向专业知识与职场任务的综合评测中,无论是基于 Elo 积分的职场知识评测 AA-Briefcase(1811 分 vs 1822 分)、评估宏观生产力价值的 GDPval-AA(1844 分 vs 1846 分),还是自动化任务基准 AutomationBench-AA(综合基准得分 71% vs 70%),Sonnet 5.5 均展现出了与旗舰 Opus 5.5 分庭抗礼的实力。不过,拉平这一代差的代价是远高于后者的 Token 消耗。
- 在最高推理强度下,Claude Sonnet 5.5 完成单个智能指数任务平均耗费约 19.3 万个输出 Token。这一规模不仅刷新了该机构测得的历史最高纪录,比同为顶配模式的 Opus 5.5 或 Sonnet 5 高出约 60%,更是竞品 GPT-6 Astra(max)消耗量的近 7 倍。
- 尽管该模型的输入与输出名义单价与竞争对手 GPT-6 Sol 相当,但在“智能水平 vs 单任务实际成本”的权衡维度下,Claude Sonnet 5.5 已经脱离了帕累托前沿。在最高推理档位下,其综合能效逊于 Opus 5.5;而在较低档位下,GPT-6 Astra 与 Sol 的配置均能以更低成本交付同等性能。
- 相对而言,Claude Sonnet 5.5 中高档位的 high effort 最具市场竞争力 —— 在实际单任务支出基本持平的前提下,其综合智能表现仅以极微弱的差距次于 GPT-6 Sol。
- 受限于次旗舰级别的模型体量,Sonnet 5.5 在事实性知识基准 AA-Omniscience 中相较 Opus 5.5 仍有明显短板:其事实准确率为 54%(Opus 5.5 为 66%),但优势在于幻觉率更低(47% vs 59%)。
- 在旨在评估智能体跨领域执行真实科研全流程能力的 Terminal-Bench-Science 榜单中,该模型取得了 53% 的成绩,仅排在 GPT-6 Astra 与 Opus 5.5 之后。目前,该科研基准评测尚未纳入 Artificial Analysis 的综合智能指数体系。
- 在考察智能体终端操控能力的 Terminal-Bench 评测中,Claude Sonnet 5.5(max)实现了突破性飞跃,在通用终端评测 Terminal-Bench 4.0 与科研专项评测 Terminal-Bench-Science 两大榜单中均稳居第一梯队。
- 在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 斩获 64% 的高分,较上一代 Sonnet 5(max)狂涨 50 个百分点,并以微弱优势压过了 Opus 5.5 与 GPT-6 Astra(xhigh 档,两者均为 60%)。
注:需要说明的是,上述评测基于 Claude Sonnet 5.5 的预发布测试版本完成Anthropic 随后证实该版本存在一处软件缺陷,导致模型在处理结构化输出请求时的性能出现异常劣化。
该问题已在正式公开发布的版本中得到修复,Anthropic 预计修复后对整体表现影响甚微。
#ClaudeSonnet5.5发布#
