小米机器人基座模型团队目前有哪些技术突破?

2026-08-10 18:47 来源:数域浪潮记

  一、双模型矩阵:Xiaomi-Robotics-0 与 Xiaomi-Robotics-1 接连落地

  Xiaomi-Robotics-0(2026年2月发布):47亿参数的VLA(视觉-语言-动作)大模型,采用“大脑+小脑”架构,具备实时推理能力,在多个仿真测试中全面超越OpenVLA等竞品。

  Xiaomi-Robotics-1(2026年7月发布,8月开源):基于10万小时真实世界操作数据预训练,配合上万小时跨本体后训练,实现“开箱即用”——机器人部署后可直接理解并执行自然语言指令,无需重新训练。

  开源策略:Xiaomi-Robotics-1在GitHub和Hugging Face同步开源,涵盖从真机训练到部署的完整流程及评测代码,极大降低行业二次开发门槛。

  二、核心训练范式:预训练+后训练的规模化突破

  预训练阶段:使用Universal Manipulation Interface(UMI)设备采集10万小时数据,覆盖家庭、工厂、餐厅、户外等1700余种场景,包含240万段交互片;团队自研自动化标注流程,2周内即可完成全量数据高质量标注。

  后训练阶段:聚焦“本体对齐”和“指令对齐”——将预训练获得的通用动作生成能力迁移至真实机器人本体,同时将状态变化描述转化为对自然语言指令的响应;使用约1万小时跨本体后训练数据。

  微调效率:面对复杂精细的新任务,仅需少量真实机器人数据即可完成高效微调,大幅降低新任务的开发与训练成本。

  三、权威评测登顶与工业级落地验证

  仿真评测领先:在RoboDojo评测中以20.07平均分数、13.93%成功率登顶榜首,大幅刷新此前纪录;在VLABench中平均成功率达59.1%,RoboCasa基准中平均成功率74.5%,均达到行业最优水平。

  “进厂打工”交出成绩单:基于Xiaomi-Robotics-0,小米人形机器人已在汽车工厂压铸车间自攻螺母上件工站连续自主运行3小时,安装成功率从90.2%提升至98%,满足76秒产线节拍。

  软硬协同闭环:团队同步研发全掌触觉仿生灵巧手,通过15万次抓握测试,在CVPR 2026和ICRA 2026上斩获冠军,形成“手脑协同”的完整技术栈。