【#GPT6正式发布#,#GPT6价格#】美东时间9月3日,GPT-6 Astra和GPT-6 Astra Pro,正式发布。
GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。
AGI时代,还被OpenAI单方面宣布「开幕」了…GPT-6发布会最后,OpenAI总裁Greg Brockman直接甩下一句:“Welcome to the AGI era.(欢迎来到AGI时代)”
据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过10万块GPU完成了预训练。
它还是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。
GPT-6的价格也正式公布,API定价为:输入:10美元/百万token;输出:50美元/百万token
相当于GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平。
基准测试接近「饱和」
GPT-6 Astra这次最核心的变化,是从「回答问题」继续向「直接完成工作」推进。
它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。
至于成绩单…谁看了都直呼离谱,其中三项成绩尤其扎眼:
FrontierMath Tier 4 v2:97.6%ARC-AGI-3:99.9%(上一代GPT-5.6 Sol是7.8%)ExploitBench:100%
一个高难数学,一个陌生环境推理,一个漏洞利用,差点全都被它刷到满分。
其中,ARC-AGI-3是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。
这个分数意味着,面对从未见过、也没有现成解法的问题,Astra已经表现出很强的自主探索和规则学习能力。
不过,这一成绩使用了OpenAI的Responses API Harness运行框架。
OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。
因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。编程Coding同样是Astra这次的重点升级方向。
在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。
在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。
数学和科学方面,Astra同样拉出了一批高分。
在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。
更突出的变化,是Astra把代码能力与Computer Use结合了起来,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。
这种变化,在更接近真实工作的Agent测试中更明显。
在Agents’ Last Exam上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。
这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。
而在更贴近真实办公流程的AutomationBench上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。
这项测试不仅看任务有没有完成,还同时呈现完成任务所需的API成本。从图中可以看到,Astra在不同成本设置下的成绩都明显高于Sol。
OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。
Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。
准确率提高的同时,完成任务所需的时间也在缩短。
这也变相解释了Astra的高定价。OpenAI认为,相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱。
在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。
但Astra最特殊的地方,还是网络安全。它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。
面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。
能力变强之后,OpenAI还专门测试了它会不会为了完成任务而越界。
在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。
当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。
也就是说,Astra不仅更会找漏洞,也更清楚哪些系统不能碰。(量子位)
