奔赴群星?GPT6 Astra发布,执行能力再度升级,上下文机制更新
> 仅仅告诉 GPT6 Astra“你在被监控”,它有时就显著少写“思考过程”。甚至出现Astra攻击成功,但没有“思考过程”、工具调用记录。(图三)
Astra,拉丁语,群星。
ad astra,向着星辰,或奔赴群星。
5.6 Sol是太阳(Solar),6则是Astra。
能力方面,主要提升复杂情况处理。能轻松处理“一大坨现实资料”:
🟢游戏开发,Unity/Godot[1]。三种主题,模型自己做原型、试玩、找问题、迭代。原型基本一次启动,人工修补减少一半。参考图复现、空间推理、UI响应、自行修复等能力大幅提升(图四);
🟢不到一分钟,一次执行吃下 41 份文档做财务报表 tie-out[2],几分钟完成,4 个“雷点”全部找到(故意埋进去的错误)。这一特定工作流强40%,但BAR benchmark总体平均提升只有3%;
🟢网络安全断层进步,逆向工程 SRE-Bench,Astra pass@4 做到 99.2%,Sol 68.7%,而且只用了大约 1/4 的输出 token;
🟢数学类、命令行测评也比较亮眼;
初步看来,提升主要在大量状态跟踪、交叉核对、长程执行。
除了模型,也得益于Astra跨上下文保存记忆的能力,并搜索以前的上下文、测试结果和工具输出。
Agent 长任务、电脑操作、复杂工具调用,也得以改善(图五,注意坐标轴)。
至于幻觉,OpenAI拿过去用户反馈说“这里说错了”的对话重新测试,发现Astra 比 Sol 更少事实错误。
本体“智能”长进,貌似不大。第三方机构,Artificial Analysis 测试 Astra low(第六代小杯),“综合智能”57 分;GPT-5.6 Sol Low 是 51,Sol high (大杯) 57,Sol Max 则有 61,而Astra Max恰好也是61。Fable 5.1 是 66。(图六)
代码方面,DeepSWE v1.1 Astra 74.1%,Sol 70.8%,看起来只涨 3.3 个百分点。
不过考虑到OpenAI基本不打榜,平时榜单成绩并不高,但实际上用起来还好,尤其是GPT5.6 Sol处理模糊需求,是独一档。不像某些模型,天天拿高分,实际很低能。还是出来用用再说吧。
但总体来说,应该是被Fable5.1[3]完全打乱了发布节奏,发布表现略拉跨。甚至弄出了全线404的错误。
尤其是今天只是给少数机构滚动更新,后面几天才陆续给其他用户跟API。(图九)
对比“太阳”5.6Sol,群星API价贵不少,2.5倍,具体看图十二。
• 输入:$10 / 100万 token (对比$4)
• 缓存输入,$1;写入$12.5 (对比$0.4)
• 输出:$50 / 100万 token (对比$20)
• Fast 模式:最高约 2.5× 速度,价格为 Standard 的 2× (对比1.5倍速,2.5倍价格;另外接下来会有Sol的14倍速,20倍价格)
好消息是,100%额度;不像A\,50%(图十)。
引用链接
[1] 游戏开发,Unity/Godot:http://t.cn/AX0xEsxm
[2] 一分钟,一次执行吃下 41 份文档做财务报表 tie-out:http://t.cn/AX0xEsx3
[3] Fable5.1:http://t.cn/AX0xEsxu
相关视频来源于OpenAI官方发布
