AIGCLINK
26-07-20 20:58 微博认证:AI博主

MiniCPM-Robot:面壁智能开源的机器人“大脑”,首发两个模型,一个管手(操作),一个管腿+眼(跟踪):

① MiniCPM-RobotManip —— 1.5B 的通用操作 VLA(视觉-语言-动作),一套权重通吃所有下游任务,仿真和真机都能跑。官方跑分里,它以 1.5B 的体量,在 RoboTwin2(hard)拿 91.6、RMBench 拿 53.3——RMBench 这项直接把 π₀.₅ 的 10.4 甩开一大截,RoboTwin2 也追平了 5B+ 的 LingBot-VA。用最小的模型打到第一梯队,这才是它敢开源的底气。

② MiniCPM-RobotTrack —— 0.9B,号称首个完全端上运行的具身目标跟踪模型。 让机器狗"盯着一个人跟":静态、动态、还有故意甩你的对抗目标都覆盖。在 EVT-Bench 上是开源 SOTA,跑在宇树 Go2 EDU 的板载算力上、纯视觉、听自然语言指令,稳定 5+ FPS / 端到端约 180ms。README 里三个 demo——户外避障跟随、电梯里跟、地下车库跟。

技术上,"怎么让小模型带上记忆还不卡":

机器人做决策要看历史画面,传统做法是每步把历史重算一遍——60 帧历史,一步决策要 125 TFLOPs,RobotManip 用流式推理把历史观测增量并进上下文,同样 60 帧只要 3.3 TFLOPs,等于用接近"单帧反应式"的在线成本,撑起了最长 1 分钟的视觉记忆。再叠上从 MiniCPM-V 4.6 继承的视觉 token 压缩(每帧 256→64,压 4 倍),单帧前向在 H100 上每步 120ms,π₀.₅ 是 234ms——快一倍。

RobotTrack 那边靠的是数据飞轮:DAgger 让模型先学通用场景,再进模拟器和真机去撞长尾(目标交叉、急转、短暂遮挡、多人穿插),被专家策略纠正的样本回炉再训,一轮轮把跟踪稳定性磨上去。

放进赛道看,这半年具身智能开源特别密——前几天聊过蚂蚁 RobbyAnt 的 LingBot 三件套(感知 Vision / 世界模型 World / 视频基座 Video),它 LingBot-VA 也在这张操作评测表里。面壁这次的差异点很清楚:别人拼参数上探能力上限,它拼"把能力压进能装进机器人板子的小模型"——1.5B 操作、0.9B 跟踪,都是奔着真上机器人、不是奔着刷榜去的。这正是机器人最缺的那块:算力受限、还要实时。

落地:
1、权重在 HF(openbmb/MiniCPM-RobotManip、RobotTrack),conda 起环境、vla_infer.py 一张图 + 一句指令就出动作块。
2、RobotTrack 有宇树 Go2 EDU 的一键部署脚本,而且发布当天 PhyAI 就做了 Day-0 适配,把 H20 上的推理从 10Hz 拉到 37Hz。

机器人的军备竞赛,正在从"谁的模型更大"转向"谁能把大模型的能力,塞进一块跑得动、还要实时的机器人板子里"。面壁这两个模型,押的是后半句。

GitHub: http://t.cn/AX9ybC70
MiniCPM-RobotManip: http://t.cn/AX9ybC7O
MiniCPM-RobotTrack: http://t.cn/AX9ybC7p

#MiniCPMRobot##具身智能##机器人##VLA##面壁智能#

发布于 美国