小小白Pro
26-09-30 06:45 微博认证:数码博主

OpenAI 今日在开发者活动日上正式发布了 GPT-6.1 Sol 模型:

据官方介绍,GPT-6.1 Sol 在智能体编程、电脑操作和专业工作流等任务上的性能接近旗舰 GPT-6 Astra,而标准输入/输出 token 价格仅为 Astra 的五分之一,官方称其为“目前同等性能下性价比最高的模型”。

定价方面,GPT-6.1 Sol 按输入上下文长度分为两档。短上下文(输入 tokens ≤ 272,000)下,标准模式每百万 tokens 输入 2 美元、缓存输入 0.1 美元、缓存写入 2.5 美元、输出 10 美元;批量与弹性模式均为输入 1 美元、缓存输入 0.05 美元、缓存写入 1.25 美元、输出 5 美元;快速模式输入 4 美元、缓存输入 0.2 美元、缓存写入 5 美元、输出 20 美元。长上下文(输入 tokens > 272,000)下,标准模式输入 4 美元、缓存输入 0.2 美元、缓存写入 5 美元、输出 15 美元;批量与弹性模式输入 2 美元、缓存输入 0.1 美元、缓存写入 2.5 美元、输出 7.5 美元;快速模式输入 8 美元、缓存输入 0.4 美元、缓存写入 10 美元、输出 30 美元。其中批量模式面向非实时的大批量任务,弹性模式平衡成本与速度,快速模式优先处理对延迟敏感的应用。

据官方公布的数据,软件工程测试(DeepSWE v1.1)中,GPT-6.1 Sol 在较高推理强度下表现与 Astra 相当,在较低推理强度/成本条件下得分比 GPT-6 Sol 高 6.4 个百分点;自动化工作流测试(AutomationBench,中等推理强度)得分比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一;电脑操作测试(OSWorld 2.0 离线,最大推理强度)得分比 GPT-6 Sol 高 7 个百分点,与 Astra 相比仅低 2.1 个百分点,但单任务成本约为 Astra 的七分之一;科学终端任务测试(Terminal-Bench Science 0.1,最大推理强度)得分达到 GPT-6 Sol 的两倍以上,单任务平均成本 5.47 美元,显著低于 Opus 5.5 的 23.21 美元和 Astra 的 23.80 美元。专业文档与复杂任务(GDP.pdf)方面,以不到 Opus 5.5 一半的任务成本取得了更好的结果。

可靠性方面,低推理强度下 GPT-6.1 Sol 的事实错误比例从 GPT-6 Sol 的 11.4% 降至 7.7%,降幅约 32%;在所有推理设置下,其错误率与 Astra 的差距控制在 1.9% 以内。此外,该模型更少忽略失效的搜索工具、更能遵循明确限制,并减少未经授权的操作,安全测试中未观察到试图绕过自动化安全审查器的行为。

GPT-6.1 Sol 已于 9 月 29 日起向 ChatGPT Work 与 Codex 的 Plus / Pro / Business / Enterprise / Edu 用户开放,开发者可通过 API 以 gpt-6.1-sol 进行调用。

发布于 四川