OpenAI 刚刚发布了 GPT-6,代号 Astra。这次训练规模史无前例,在得克萨斯州的 Stargate 数据中心调用了超过 10 万块 GPU。发布会最后,OpenAI 总裁 Greg Brockman 说出了那句话:"欢迎来到 AGI 时代。" 他的意思是,如果几年后有人追问 AGI 究竟从哪一天开始,答案很可能就是今天。
这次发布最核心的变化,是 GPT-6 Astra 已经从「回答问题」升级成了「直接完成工作」。
以前用 AI,你还得把它的回答复制出来,自己去软件里操作。Astra 直接跳过这一步,它能自己打开浏览器、进入专业软件,帮你画电路板、建 3D 模型、写代码、做游戏,最后交给你一个可以直接用的成品。找儿科医生这件事,人工搜索要花将近 5 个小时,Astra 用了不到 3 分钟。法律平台 Legora 让它一口气核查 41 份财务文件,4 处预先埋入的错误一个没漏。游戏公司 Playco 让它直接进 Unity 做游戏原型,人工修补的工作量减少了一半。
跑分层面,数字更是让人瞠目结舌。ARC-AGI-3 这项专门考察模型面对陌生环境的推理测试,上一代 GPT-5.6 Sol 得了 7.8%,Astra 直接打到 99.9%。高难数学测试 FrontierMath Tier 4 v2 得了 97.6%,漏洞利用测试 ExploitBench 直接满分 100%。
说到安全,Astra 是 OpenAI 第一个达到「关键网络安全能力」门槛的模型,测试期间它自主发现了两个此前没人知道的 V8 零日漏洞。OpenAI 表示,最强的相关能力不会完整开放给所有用户。
还有一个值得关注的细节:Astra 的训练过程里,上一代模型已经开始承担生成数据、检查输出、发现训练异常等工作。AI 训练 AI 的循环正在悄悄转起来。
价格方面,Astra 的 API 定价是上一代 Sol 的 2.5 倍。Brockman 对此的回应是:用「每百万 Token 多少钱」来衡量 AI 成本,这个思路本身已经过时了。真正的问题是完成一项完整任务要花多少钱。Astra 单价贵,但能一次把事情做对、减少反复,算下来总成本未必更高。
当然,这次发布也不是没有隐忧。Astra 在行为上更守规矩,越权操作测试里得了 0%,但它的思考过程却比上一代更难被人看懂,推理越来越往模型内部「藏」,外部已经很难追踪它为什么做出某个判断。OpenAI 首席科学家直接把「模型可监控性」列为未来 Scaling 面临的重要挑战之一。
对做 AI 应用的团队来说,这次发布传递的信号很清楚:靠堆 Prompt 和固定流程建起来的壁垒,会越来越脆。接下来真正有价值的,是你对任务的定义能力、你手里的真实数据,以及你能不能清楚说出什么叫「做好了」。
#科技先锋官##How I AI#
