爱可可-爱生活
26-07-23 05:34 微博认证:AI博主 2025微博新锐新知博主

[CV]《Masked Visual Actions for Unified World Modeling》H Alzayer, W Huang, H Chen, C Luey… [Stanford University] (2026)

在机器人世界模型领域,传统方法依赖低维动作向量或特定构型的骨架,导致控制信号与预训练视频模型的视觉先验严重失配。这种表征的异构性限制了模型在不同机器人形态间的泛化,使其难以直接利用视频数据中蕴含的丰富物理交互规律。

本文的核心洞见是将机器人动作重新定义为像素空间的掩码轨迹。通过对视频中的特定实体进行掩码处理,模型能根据揭示的机器人路径预测场景响应,或根据目标物体运动反推机器人行为。这种统一的视觉接口让动作与视频表征完全对齐,实现了跨构型的零样本控制。

这项工作证明了通用视频模型可通过轻量化微调转化为高效的物理模拟器,为策略评估与模型预测控制提供了统一框架。它打破了动作空间的构型限制,为构建通用具身智能打开了大门,但目前的局限在于模型仍倾向于捕捉统计相关性而非深层因果逻辑。

arxiv.org/abs/2607.19343 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京