每天玩AI
26-09-04 08:09 微博认证:AI博主

快讯|OpenAI发布GPT‑6 Astra:迈向Agent时代的代际模型

美东时间9月3日,OpenAI正式推出旗舰模型GPT‑6 Astra,官方将其定义为“全球最智能、对齐水平最高”的大模型,在抽象推理、科学数学、网络安全、计算机操控等多项前沿基准取得接近饱和的成绩。

公开基准数据:ARC‑AGI‑3达99.9%,ExploitBench拿到满分100%,FrontierMath Tier 4高等数学基准达到97.6%‑98%,已经辅助攻克部分长期悬而未决的数学难题。OSWorld 2.0计算机使用任务速度提升47%;BenchCAD、Terminal‑Bench Science、Agents’ Last Exam等评测同样交出行业领先结果。

需要留意,ARC‑AGI‑3的高分高度依赖Responses API专用工具链与状态保留机制;脱离特殊 harness的普通调用,实测分数回落至17%‑63%,不能把基准跑分直接等同于日常对话能力。

本次最大升级不在于聊天效果,而是Agent智能体实操能力。Astra可以自主操控电脑,完成填表、办公文档处理、前端测试、PCB布局、Blender建模导出等一整套复杂实操任务;结构化输出、专业工作流处理能力大幅增强。安全对齐方面,无防护环境下越界操作比例从上一代48%降至0%,模型可以自主判断什么时候需要向用户确认,什么时候自主推进任务。

API定价:输入10美元/百万token,输出50美元/百万token。虽然单token单价更高,但任务完成效率提升,部分场景整体实际成本反而下降。

上线节奏:现阶段优先向部分机构与可信访问项目开放;未来几天逐步放开至ChatGPT Plus、Pro、Business、Enterprise全量付费用户,同时开放OpenAI API与AWS渠道,企业端可在工作区手动开关该模型。

社区出现“AGI已经到来”的热烈讨论,但行业视角仍需理性看待。尽管Astra的多步规划、工具调用、实操能力实现巨大跨越,但依旧存在幻觉、长链路任务偶发失败等问题。多数业内观点认为,它是距离AGI门槛很近的强大智能体模型,通用人工智能是否实现,学术界与产业界尚未达成共识。

总体来看,GPT‑6 Astra标志AI从问答助手进一步向可委托复杂任务的数字同事演进,但基准条件、真实场景表现之间仍存在鸿沟,不能仅凭跑分高估日常使用效果。

发布于 马来西亚