#AlphaEvolve:利用大型语言模型自动发现多智能体学习算法#
1. 引言
在人工智能领域,多智能体强化学习(Multi-Agent Reinforcement Learning,MARL)已在如扑克和实时策略游戏等复杂环境中取得了超人类水平的表现。然而,这些算法的设计仍高度依赖人工直觉和反复试验——研究者需要手动选择更新规则、折扣方案和元策略。这种依赖人类经验的过程不仅低效,还限制了探索广阔算法空间的可能性。
Google DeepMind的最新研究引入了AlphaEvolve,这是一个由大型语言模型(LLM)驱动的进化框架,能够自动发现新型MARL算法。该系统将算法源代码视为“基因组”,利用LLM进行语义上有意义的变异(如重写逻辑、添加控制流或注入符号操作),从而探索超出传统超参数调优的组合空间。研究聚焦于不完美信息游戏的两大范式:迭代遗憾最小化(Iterative Regret Minimization)和基于种群的训练(Population-Based Training),并在游戏理论基准上展示了优越性能。
这项工作标志着AI系统从工具向设计者角色的转变:AI不仅能学习,还能设计出比人类更好的学习算法。这不仅仅是优化,而是递归创新的开始。更多框架细节可参阅DeepMind官方博客:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms
2. AlphaEvolve框架的核心机制
AlphaEvolve的设计灵感来源于进化算法,但以LLM为核心引擎,实现代码级别的智能变异。框架流程如下:
2.1 种群初始化:从现有基线算法(如标准CFR或Uniform PSRO)开始,构建初始代码种群。
2.2 LLM驱动的变异:使用Gemini 2.5 Pro等LLM,根据提示修改父代码。例如,提示可能要求“改进遗憾累积逻辑,以减少波动性”。LLM生成的变异是语义连贯的,而非随机扰动,确保代码语法有效且逻辑合理。
2.3 自动化评估:在代理游戏(如Kuhn Poker)上运行候选算法,计算适应度(负可利用度,exploitability)。这确保客观、可重复的反馈。
2.4 进化选择:保留高适应度候选,形成下一代种群。框架支持多目标优化,平衡收敛速度和泛化能力。
这种方法的关键优势在于其通用性:只要问题可用代码描述并自动验证,AlphaEvolve即可适用。研究中,它被应用于不完美信息游戏,但潜力延伸至深度RL和合作场景。
3. 发现的新算法:VAD-CFR
在迭代遗憾最小化范式下,AlphaEvolve演化出了Volatility-Adaptive Discounted CFR (VAD-CFR),一个新型CFR变体。CFR(Counterfactual Regret Minimization)是解决不完美信息游戏的核心算法,通过最小化累积遗憾来逼近Nash均衡。
VAD-CFR的关键创新包括:
3.1 波动性自适应折扣:基于遗憾幅度的指数加权移动平均(EWMA)动态调整折扣因子,减少高波动环境中的不稳定性。
3.2 非对称即时提升:正遗憾值乘以1.1倍,促进即时利用,而负遗憾保持不变。
3.3 硬热启动策略累积:从第500次迭代开始累积策略(无先验知识告知评估horizon为1000次),并按即时遗憾幅度加权策略。
在训练集(3人Kuhn Poker、2人Leduc Poker等)和测试集(更大游戏如6面Liar’s Dice)上,VAD-CFR的收敛速度更快,可利用度更低。在11个游戏中,它在10个中击败了基线(如CFR+、DCFR、HS-PCFR+),证明了其泛化能力。详细机制见论文:http://t.cn/AXcM9j2t
4. 发现的新算法:SHOR-PSRO
在基于种群的训练范式下,AlphaEvolve演化出了Smoothed Hybrid Optimistic Regret PSRO (SHOR-PSRO),一个混合元求解器。PSRO(Policy Space Response Oracles)通过迭代生成最佳响应策略来扩展种群,逼近均衡。
SHOR-PSRO的创新包括:
4.1 混合元求解器:融合Optimistic Regret Matching (ORM)与最佳纯策略的softmax混合,平衡稳定性和贪婪利用。
4.2 动态退火:混合因子λ从0.3退火至0.05;多样性奖金从0.05衰减至0.001,促进从探索向利用的转变。
4.3 训练 vs. 评估不对称:训练时使用平均策略,促进多样性;评估时使用最后迭代策略,提高反应性。
在相同基准上,SHOR-PSRO在8个游戏中优于基线(如Uniform、Nash、AlphaRank、PRD),显示出更快的收敛和更好的均衡逼近。完整描述见:http://t.cn/AXcM9j2t
5. 实验结果与基准比较
研究使用OpenSpiel框架在多种游戏上评估:
5.1 基准游戏:Kuhn Poker、Leduc Poker、Goofspiel、Liar’s Dice(玩家数2-6,面数3-6)。
5.2 性能指标:可利用度(对数尺度)、收敛速度、泛化性能。
5.3 基线比较:VAD-CFR优于CFR家族变体;SHOR-PSRO优于PSRO元求解器。
这些发现是非直观的——例如,VAD-CFR的500次热启动阈值并非人类设计,而是通过进化发现的。这突显了AlphaEvolve在超越人类偏见方面的潜力。
6. 讨论与局限性
AlphaEvolve的成功证明了LLM在算法发现中的作用:它不仅生成代码,还注入洞见,如波动适应和动态退火。发现的算法可读性强,便于人类分析和部署。
然而,局限包括:
6.1 依赖LLM提示质量和训练游戏多样性。
6.2 可能不直接泛化至所有游戏类型(如完美信息游戏)。
6.3 与先前工作(如AutoML-Zero)相比,AlphaEvolve保留了可解释性,但计算成本较高。
7. 结论与未来展望
这项研究开启了自动化算法发现的新时代:从手动试错到AI驱动进化。AlphaEvolve不限于MARL,可扩展至材料科学、药物发现等领域。未来,DeepMind计划将其应用于深度RL代理和合作游戏,推动AI的递归进步。
这项突破提醒我们:AI正在设计更好的AI,而人类的作用正从创造者转向合作者。更多细节请参阅原论文:http://t.cn/AXcM9j2t 或DeepMind官方介绍:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms
作者:Zun Li、John Schultz、Daniel Hennes 和 Marc Lanctot(Google DeepMind)
发布日期:2026年2月24日(arXiv提交日期:2026年2月18日,最新修订2月21日)
来源:Google DeepMind研究论文 → arXiv:2602.16928 (http://t.cn/AXcM9j2t) (PDF下载:http://t.cn/AXcM9j2c)
