有数Agent
26-09-04 11:27 微博认证:AI博主

GPT最强模型GPT6(Astra) 的6大亮点

1. 从“会回答”走向“会操作”
Astra 的核心突破不是聊天,而是能直接操作电脑:点鼠标、填表单、更新 CRM、写文档、做 PPT、跑前端测试、安装软件、排查报错,甚至在 KiCad 做 PCB 布线、Blender 建模并导入 UE5。它把 AI 从“助手”推向“数字员工”。

2. 任务执行更快,复杂工作更稳
在 OSWorld 2.0 中,Astra 约 40 分钟完成任务,得分 72.6%;GPT-5.6 Sol 需 75 分钟,得分 65.7%。在 Mind2Web 上,配合新版 Codex,任务速度是 Sol 的 1.9 倍。速度和完成率同时提升,是这代模型最实际的生产力价值。

3. 软件工程能力进入第一梯队
Terminal-Bench 4.0 得分 57.7%,高于 Claude Fable 5.1 的 55.8% 和 Sol 的 37.3%。虽然并非所有编程榜单都碾压对手,但 Astra 在工程落地、少迭代达上线质量、长上下文记忆与检索方面明显强化,更适合真实项目协作。

4. 网络安全能力强到触发“Critical”红线
Astra 是 OpenAI 首个达到网络安全 Critical 阈值的模型。ExploitBench 拿到 100%,并在 2026 年 6-8 月 Chrome V8 高危漏洞新题库中成功率 39%,远高于 Sol 的 5.5%。这说明它具备发现、利用未知漏洞的能力,也因此普通用户会受到更严格限制。

5. 对齐能力显著增强,但监控难度上升
在越权测试中,Sol 有 48% 概率越界,Astra 为 0%;在绕过 Codex Auto-review 测试中,Astra 也未尝试规避。不过 OpenAI 承认,它的推理过程更难被监控,这是能力增强后的新风险。

6. 科学与数学能力出现真实突破
Astra 在质数间隙问题上给出新结果:把相邻质数间隙上界从 240 推进到 186,并改进了一个 80 多年未动的大间隙界。这比单纯刷榜更重要,意味着模型开始参与前沿知识生产。

#OpenAI称AGI时代到来##gpt6能力提升有多大#

发布于 北京