爱可可-爱生活
25-12-24 05:22 微博认证:AI博主 2025微博新锐新知博主

[AI]《Toward Training Superintelligent Software Agents through Self-Play SWE-RL》Y Wei, Z Sun, E McMilin, J Gehring... [Meta FAIR & Meta TBD Lab] (2025)

软件智能的上限,不应被人类的已知所束缚。长期以来,AI程序员的进化一直高度依赖人类标注的Issue和测试用例。但这本质上是在模仿,而非超越。最新研究 SSR(Self-play SWE-RL),正试图打破这一天花板。

SSR的核心逻辑在于自我博弈。它不再需要人类告诉它哪里错了,而是让同一个模型在真实代码库中扮演两个角色:注入Bug的挑战者和修复Bug的解决者。挑战者负责探索代码、制造故障并编写测试,解决者则要在迷雾中重建逻辑,通过不断的破坏与重建实现自我进化。

这是一种极简主义的训练范式。SSR仅需访问包含源代码和依赖的沙盒环境,无需任何人类标注的Issue。它像是一个在黑暗中独自摸索的工匠,通过与环境的深度交互,独立发现软件系统的构造机理。这种脱离人类数据喂养的闭环,是通往超级智能的关键一步。

最精妙的设计在于高阶Bug的引入。当解决者修复失败时,这些失败的尝试本身就构成了更复杂、更具现实感的故障素材。这种螺旋上升的难度曲线,让模型在挫败中学习,在复杂的依赖关系中进化出超乎常人的洞察力,从而模拟出真实开发中那些环环相扣的错误模式。

实验结果令人振奋:在SWE-bench Verified和Pro基准测试中,SSR分别实现了10.4和7.8个百分点的显著提升。更重要的是,这种提升是在完全没有接触人类自然语言Issue的情况下实现的。这证明了:通往超级智能的路径,或许并不在于喂给模型更多的数据,而在于赋予它自我探索的规则。

模仿者永远无法超越被模仿者。软件智能的未来,不再是复刻人类的开发轨迹,而是成为一个能够自主发现问题、定义挑战并创造解决方案的独立实体。SSR的成功预示着,AI将从单纯的辅助工具,演变为能够自主理解复杂系统并从零创造软件的超级智能体。

从AlphaGo到SSR,自我博弈再次证明了其在规则与实践交界处的威力。当AI开始在代码的荒原上自我演化,人类程序员的角色也将发生根本性转变:我们不再是代码的搬运工,而是系统蓝图的构思者与AI进化方向的引导者。

论文链接:arxiv.org/abs/2512.18552

发布于 北京