[RO]《Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning》V Giridhar, A Khandelwal, J A. Collins, I Georgiev… [Georgia Institute of Technology] (2026)
在机器人模仿学习领域,策略无法从部署失败中自我改进是核心难题。过去的方法受困于昂贵的在线微调,本质原因是模仿范式无法消化失败数据,而直接更新大模型又极易破坏其学到的先验知识。
本文的核心洞见是:将策略改进解耦为“模仿”与“评价”。由此,仅用部署中的所有(含失败)轨迹更新一个小型Q函数,让它指导冻结的模仿策略进行动作选择,问题便得以解开。
这项工作留下的遗产是一种低成本、安全的模型演化路径:冻结大策略,仅更新小价值。它打开的新门是为任意基础模型加装在线“决策脑”,但其探索范围仍受限于原始策略的提案能力。
arxiv.org/abs/2608.21204 #机器学习# #人工智能# #论文# #AI创造营#
发布于 北京
