人形机器人和自动驾驶最大的不同,是它没有海量真实数据可学。高质量的机器人交互数据非常稀缺,行业目前只能靠遥操作、人工示教和真机采集,一条一条地记录机器人在真实环境中的观察与动作——成本高、周期长,也很难覆盖陌生光照、复杂背景和各种长尾场景。"数据荒",是横在整个具身智能面前一道绕不开的坎。
今天,小米正式开源多模态具身智能生成模型 Xiaomi-Robotics-U0。"U"代表 Unified(统一),"0"代表新的起点。它是小米首个、也是行业首个统一具身生成基础模型,用一套多模态自回归架构,统一支持具身场景生成、具身迁移、机器人交互视频生成以及通用图像生成与编辑。在保持机器人动作与空间关系一致的前提下,它能更换物体、光照和背景,批量扩充真实采集难以覆盖的陌生、极端和长尾场景,帮助行业缓解人形机器人训练中的"数据荒"问题。
在清华大学、北京大学等机构联合打造的 WorldArena 评测基准中,Xiaomi-Robotics-U0 获得 73.64 分,在全球参与测评的 126 个模型中综合排名第一,并在指令遵循、交互质量、视角一致性三个核心子项全部位列第一。而更让我们看重的是真机验证:在陌生光照、未知背景等干扰场景下,用 U0 扩增数据训练的策略,任务完成进度平均提升 26.3%——生成的数据,确实提升了机器人的实际表现。
我们把 U0 全面开源,不只是为小米自己的机器人研发,更希望它成为具身智能社区探索生成式数据、世界模型和机器人泛化能力的一块基础能力,为行业提供一套高效、低成本、可控的大规模具身数据生产方案。数据荒是行业共同的难题,我们愿意先把这条路蹚开,和大家一起往前走。[心]
http://t.cn/AXKNEQXZ
发布于 北京
