投星资产
26-09-07 15:48 微博认证:投资内容创作者

历史性大突破,用AI训练AI,飞轮转起来了。

9月6日,OpenAI在其官方博客发布题为《研究加速:OpenAI内部视角》(Research acceleration: The view inside OpenAI)的长文,首次以内部数据形式系统披露AI"递归自我改进"(Recursive Self-Improvement, RSI)的实质性进展。

文章证实,OpenAI已实现去年秋天设定的关键里程碑——在今年9月前打造出"自动化研究实习生"系统。截至8月中旬,其研究部门的智能体工作量已达到人类研究员的3.1倍,标志着"AI训练AI"的飞轮已正式开启自转。

一、里程碑达成:从"研究实习生"到"AI研究员"的路线图

OpenAI在文中对"自动化研究实习生"给出了明确定义:"一个能在人类指导下执行明确定义的研究任务的系统,包括那些需要一名熟练研究员数天才能完成的任务。"

这一目标的实现意味着AI系统已能独立承担传统上由初级研究人员完成的实质性工作。OpenAI同时公布了下一阶段的雄心:在2028年3月前实现完整的"自动化AI研究员",使其能够参与深度学习和对齐研究,并通过迭代进一步改进系统自身。

这一路线图勾勒出一条清晰的能力跃升路径:从执行明确指令的实习生,到能够自主提出研究方向、设计实验并推动领域进展的独立研究者。

二、内部数据揭秘:智能体如何重塑研究部门

OpenAI此次披露的数据,是外界首次得以窥见其研究部门内部人机协作的真实比例。

使用量爆发式增长,从使用规模看,研究部门的智能体 adoption 速度远超公司其他团队。

以中位员工的输出Token变化计算,研究部门的智能体使用规模较2025年12月增长了124倍。

具体而言,按API价格折算,中位研究员每天的智能体推理使用额已超过600美元;而使用量处于前10%的研究员,每天消耗的Token价值则超过7000美元。OpenAI还观察到,越来越多研究员会同时运行4个或更多智能体会话。

3.1倍:人机工作量的历史性逆转最关键的转折点发生在今年6月。在此之前,研究组织的智能体总运行时长仍低于人类劳动总时长;此后情况发生逆转。截至8月中旬,以标准8小时工作日计算,每消耗1个人类工作日,研究组织的智能体已产出3.1个工作日的工作量。这意味着在OpenAI的研究部门,AI智能体已不再是辅助工具,而是成为实际上的主要"劳动力"来源。

三、飞轮效应:研发循环的全面加速

OpenAI将AI研发描述为一条包含多个环节的流程:提出改进方案、设计评估、编写基础设施、进行大规模测试、发现训练中的错误或不安全行为,并将有效方案整合进核心训练。智能体的介入正在压缩这一循环中的等待时间。

数据显示,公司工程师整体代码交付速度显著提升。更重要的是,2026年以来每名活跃实验人员对应的实验数量持续增加,8月达到自2025年1月开始跟踪以来的新高。OpenAI坦承,这一趋势与Codex使用增加存在相关性,但也强调算力增长是同步变量,不能将实验增长完全归因于智能体。

OpenAI指出,这种加速形成了典型的飞轮效应:AI产出更多代码和实验结果→研究进展加快→更好的模型被训练出来→反过来提升智能体能力。但同时警告,随着自动化推进,最不易被自动化的任务可能占据研究人员更多时间,成为新的瓶颈;算力也可能在其他瓶颈减弱后变得更加关键。

OpenAI此次披露的内部数据,是AI发展史上首次有顶尖实验室以量化方式公开RSI进程。3.1倍的工作量比例、124倍的使用增长、以及明确的"自动化AI研究员"时间表,都表明"AI训练AI"已从理论构想进入实操阶段。

发布于 北京