爱可可-爱生活
25-11-20 05:49 微博认证:AI博主 2025微博新锐新知博主

[RO]《Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language》M Hwang, A Forsey-Smerek, N Dennler, A Bobu [MIT CSAIL] (2025)

机器人通过演示学习用户偏好,往往面临“学会做什么”而“不清楚重点是什么”的困境,导致奖励模型容易过拟合于演示中的无关状态细节。针对这一难题,研究团队提出了Masked IRL——一种结合大语言模型(LLM)推理能力的反向强化学习方法,显著提升了奖励学习的泛化性和样本效率。

核心洞察在于演示和语言的互补性:演示告诉机器人“如何行动”,而语言明确“什么最重要”。Masked IRL利用LLM从模糊语言指令中推断出状态相关性掩码,形成掩码损失,强制奖励模型对无关状态成分保持不变,避免捕捉伪相关。同时,当语言指令不明确时,LLM会结合演示轨迹推理澄清指令含义,生成更为具体的任务描述。

方法架构上,Masked IRL通过预训练语言编码器(T5)融合语言与状态信息,使用FiLM层调制状态输入,输出条件化奖励值。训练时结合最大熵IRL损失与掩码损失,显著减少对演示数量的需求(最多减少4.7倍)。在模拟与真实的7自由度机械臂递送咖啡杯任务中,Masked IRL超过现有语言条件IRL方法15%的性能提升,同时对含糊指令表现出更强鲁棒性。

实验亮点包括:
1. 掩码损失有效减少模型对无关状态的敏感度,提升泛化能力和样本效率,尤其在LLM生成的掩码存在噪声时仍表现稳定优异。
2. 语言-演示联合推理机制成功澄清模糊指令(如“Stay away”),将其具体化为“远离笔记本”,提升奖励学习精度。
3. 真实机器人实验验证了方法的零样本泛化能力,奖励模型在真实环境中表现出更低的奖励方差和更小的轨迹优化遗憾。

Masked IRL不仅为机器人个性化行为学习打开新路径,也为多模态反馈融合提供了系统性范式。未来工作将聚焦提升LLM掩码预测准确度、扩展到更复杂多变环境,以及引入不确定性估计以增强现实部署的可靠性。

原文及代码请见:github.com/MIT-CLEAR-Lab/Masked-IRL
论文链接:arxiv.org/abs/2511.14565

“演示教你怎么做,语言告诉你做什么重要。”Masked IRL通过智能掩码让机器人学会聚焦本质,从而用更少的演示,做得更好、更稳。

发布于 北京