在性能方面,在智能体编程、电脑操作和专业工作流等任务上,性能接近旗舰 GPT‑6 Astra,但标准输入 / 输出 token 价格只有 Astra 的五分之一。
软件工程(DeepSWE v1.1):在较高推理强度下,GPT‑6.1 Sol 的表现与 GPT‑6 Astra 相当;在较低推理强度 / 成本条件下,其得分比 GPT‑6 Sol 高出 6.4 个百分点。
专业文档与复杂任务(GDP.pdf):以不到 Opus 5.5 一半的任务成本,取得更好结果。
自动化工作流(AutomationBench,中等推理强度):得分比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一。
电脑操作(OSWorld 2.0 离线,最大推理强度):得分比 GPT‑6 Sol 高 7 个百分点,成本不足后者一半;与 Astra 相比仅低 2.1 个百分点,但单任务成本约为 Astra 的七分之一。
科学终端任务(Terminal‑Bench Science 0.1,最大推理强度):得分是 GPT‑6 Sol 的两倍以上;单任务平均成本 $5.47,显著低于 Opus 5.5($23.21)和 Astra($23.80)。#撒贝宁龙凤胎长这么大了#
发布于 广东
