新智元
26-09-03 14:15 微博认证:新智元官方微博

刚刚,OpenAI新Transformer火了!Astra架构首次曝光#科技先锋官#

OpenAI下一代Astra被曝采用"循环深度"(recurrent depth)全新推理架构,思考Token大幅减少但性能反而拉爆,怪不得灰测实力惊人。

OpenAI首席科学家Jakub Pachocki回应称,目前最前沿模型(含Astra)计算图深度顶多是GPT-4的两倍,没外界传的那么玄乎;同时有大V爆料gpt-6-astra已现身API,GPT-6预计明天上线。

"循环深度"又称"循环Transformer",并非OpenAI首创。传统Transformer像只能走一遍的高楼,数据逐层爬到顶做固定次数运算;循环Transformer则让同一组层反复循环使用,隐藏状态送回起点多轮加工才吐出结果,相当于不加参数、靠多跑几圈就拉长有效计算深度。

谷歌2025年论文显示,k层循环L次的Transformer在推理任务上可接近k×L层的普通模型;另一篇"潜在推理"论文中,35亿参数小模型循环足够多圈后,打出了500亿大模型的成绩,等于给测试时算力开了超频开关。

危险之处在于,"循环深度"把思考逼进了盲区。以往CoT是模型打草稿的工作记忆,思考必须挤成人类能读懂的文字;而循环块让模型在向量世界里默默转完多轮串行推理,全程不吐一个字,人类由此彻底失去对AI思考过程的可见性。

Meta"连续思维链"(Coconut)研究也指出,模型用向量推理可能比被逼着用人类语言更准、更省,因为强迫每步翻译成人话本就会损失信息。

该架构对数学、编程等依赖"多次迭代"的任务尤其有利,也带来全新的推理时Scaling方式:计算可在输出Token前于内部完成。据称Astra在前端领域已展现统治力,奥特曼称其计算机使用能力媲美人类,且能持续运行数周不间断。