黄健楸
26-09-04 06:01 微博认证:AI博主

奔赴群星?GPT6 Astra发布,执行能力再度升级,上下文机制更新

> 仅仅告诉 GPT6 Astra“你在被监控”,它有时就显著少写“思考过程”。甚至出现Astra攻击成功,但没有“思考过程”、工具调用记录。(图三)

Astra,拉丁语,群星。

ad astra,向着星辰,或奔赴群星。

5.6 Sol是太阳(Solar),6则是Astra。

能力方面,主要提升复杂情况处理。能轻松处理“一大坨现实资料”:

🟢游戏开发,Unity/Godot[1]。三种主题,模型自己做原型、试玩、找问题、迭代。原型基本一次启动,人工修补减少一半。参考图复现、空间推理、UI响应、自行修复等能力大幅提升(图四);

🟢不到一分钟,一次执行吃下 41 份文档做财务报表 tie-out[2],几分钟完成,4 个“雷点”全部找到(故意埋进去的错误)。这一特定工作流强40%,但BAR benchmark总体平均提升只有3%;

🟢网络安全断层进步,逆向工程 SRE-Bench,Astra pass@4 做到 99.2%,Sol 68.7%,而且只用了大约 1/4 的输出 token;

🟢数学类、命令行测评也比较亮眼;

初步看来,提升主要在大量状态跟踪、交叉核对、长程执行。

除了模型,也得益于Astra跨上下文保存记忆的能力,并搜索以前的上下文、测试结果和工具输出。

Agent 长任务、电脑操作、复杂工具调用,也得以改善(图五,注意坐标轴)。

至于幻觉,OpenAI拿过去用户反馈说“这里说错了”的对话重新测试,发现Astra 比 Sol 更少事实错误。

本体“智能”长进,貌似不大。第三方机构,Artificial Analysis 测试 Astra low(第六代小杯),“综合智能”57 分;GPT-5.6 Sol Low 是 51,Sol high (大杯) 57,Sol Max 则有 61,而Astra Max恰好也是61。Fable 5.1 是 66。(图六)

代码方面,DeepSWE v1.1 Astra 74.1%,Sol 70.8%,看起来只涨 3.3 个百分点。

不过考虑到OpenAI基本不打榜,平时榜单成绩并不高,但实际上用起来还好,尤其是GPT5.6 Sol处理模糊需求,是独一档。不像某些模型,天天拿高分,实际很低能。还是出来用用再说吧。

但总体来说,应该是被Fable5.1[3]完全打乱了发布节奏,发布表现略拉跨。甚至弄出了全线404的错误。

尤其是今天只是给少数机构滚动更新,后面几天才陆续给其他用户跟API。(图九)

对比“太阳”5.6Sol,群星API价贵不少,2.5倍,具体看图十二。

• 输入:$10 / 100万 token (对比$4)
• 缓存输入,$1;写入$12.5 (对比$0.4)
• 输出:$50 / 100万 token (对比$20)
• Fast 模式:最高约 2.5× 速度,价格为 Standard 的 2× (对比1.5倍速,2.5倍价格;另外接下来会有Sol的14倍速,20倍价格)

好消息是,100%额度;不像A\,50%(图十)。

引用链接
[1] 游戏开发,Unity/Godot:http://t.cn/AX0xEsxm
[2] 一分钟,一次执行吃下 41 份文档做财务报表 tie-out:http://t.cn/AX0xEsx3
[3] Fable5.1:http://t.cn/AX0xEsxu

相关视频来源于OpenAI官方发布

发布于 广东