[AI]《SIMA 2: A Generalist Embodied Agent for Virtual Worlds》S t A Bolton, A Lerchner, A Cordell, A Moufarek... [Google DeepMind] (2025)
我们推出了SIM A 2,一款基于Gemini基础模型的通用化身智能体,能够在多样的3D虚拟世界中理解环境、推理目标、执行复杂操作,并与用户对话。相比前作SIM A 1只能执行简单指令,SIM A 2实现了交互式伙伴的跃升:具备多步骤规划、内在推理和多模态提示能力,能用语言及图像接收复杂指令,显著提升了任务完成率,表现接近人类水平。
SIM A 2通过在多款开放世界游戏(如Space Engineers、No Man’s Sky、Valheim等)以及研究环境中训练,展示了强大的泛化能力,能够适应此前未见的环境和视觉风格,包括由生成式世界模型Genie 3构建的逼真场景。更难能可贵的是,SIM A 2实现了开放式自我提升:借助Gemini生成任务和评估奖励,能在新环境中自主学习新技能,无需人工示范,迈出了实现持续进化智能体的关键一步。
技术核心上,SIM A 2使用视觉-语言-行动统一的序列生成方式,输入为720p RGB画面和语言指令,输出可解析为键鼠操作与文本(包括内在推理和对话)。训练数据涵盖大量人类游戏演示、任务特定示范及Gemini合成的桥接数据,保证了低级动作控制与高级语言理解的结合。训练后还辅以强化学习,提升策略表现。
评测方面,SIM A 2相较SIM A 1在所有训练环境任务上成功率大幅提升,甚至在完全未见环境(如ASKA、MineDojo的Minecraft子集)中表现更优,且在多模态复杂指令、跨语言和符号(表情)提示下均能准确执行。与未经微调的Gemini基础模型相比,SIM A 2虽经过专门的动作数据训练,但保留了强大的推理、代码生成和数学能力,未出现显著遗忘。
我们还将SIM A 2与更强大的Gemini Pro模型结合,构建层级系统,利用Gemini Pro进行高级推理与任务分解,SIM A 2负责执行,实现了对复杂多步任务(如根据图表搭建营火)的成功完成,进一步拓展了智能体的能力边界。
这项工作不仅是通用体现智能体的重要里程碑,也为未来将虚拟学习迁移至物理机器人铺平道路。SIM A 2的持续自我提升能力,展示了朝着永无止境的自主学习和适应迈进的可能路径。尽管目前仍面临长时记忆限制和精细动作控制等挑战,但SIM A 2已经证明:集成先进基础模型与多样训练环境,能创造出既懂推理又能灵活行动的智能体。
全文详见:arxiv.org/abs/2512.04797
