西里森森
26-09-10 21:18 微博认证:AI博主

今天早上,有朋友在群里发了几个视频,是最近全网刷屏的GPT-6 Astra直接操纵机械臂的画面。

很多群友看完,第一反应都是:完了,具身智能这个赛道没得玩了😂

刚好今天在外滩大会上,也聊到了这个话题。

主持人问自变量创始人王潜,GPT-6 Astra已经能直接控制机械臂,具身智能公司会不会被通用大模型降维打击?

这其实是一个非常尖锐的问题,因为在Robocurve实机测试中,Astra的成功率达到了95%,远高于Claude Fable 5.1的40%。

但王潜没急着谈输赢,而是提醒大家先想清楚一个问题:Astra究竟是靠什么学会动作的?
顺着这个问题往下看,机器人行业真正的壁垒才慢慢露出来。

1
很多人可能忽略了一点:GPT-6 Astra之所以能控制机器人,并不是因为语言模型突然自己悟出了动作能力。
这个版本的模型,本身就训练了大量机器人数据。

从去年年初开始,OpenAI和Anthropic就在采购相关数据,也建立了小规模的数据工厂,它们还招募了不少机器人领域的人才。

所以Astra能做出这些动作,其实不算意外。
它本来就是一个能力很强的多模态模型,现在又吃进了大量机器人数据,自然会表现出一定的操作能力。

这个区别很重要,因为如果一个模型在学习机器人数据之后学会了控制机械臂,恰恰说明机器人预训练是有效的。它并不能证明,语言能力可以自然替代具身智能。
真正需要关注的,是它具体能把动作做到什么程度。

2
在Robocurve实机测试基准中,面对方块入碗这个任务,GPT-6 Astra的成功率达到了95%,Claude Fable 5.1只有40%,差距确实非常明显。
但到了拼图入槽,Astra的成功率只剩10%,和Claude Fable 5.1处在同一水平。

为什么只是换了一个测试任务,成功率瞬间就从95%突然掉到了10%?

原因很简单,方块入碗有点像把一个快递盒放进纸箱,位置偏一点,方向歪一点,通常也能放进去。
但拼图入槽像是把钥匙插进锁孔,机械臂需要找准角度,还要控制接触时的力度。任何一个细小偏差,都可能让任务失败。

前者更依赖大致正确的视觉理解,后者要求模型真正处理物理世界里的细节。

3
王潜在访谈里还提到了一个很有意思的观点。
他认为,智能的本体存在于数据之中。模型在训练时更像一个“蒸馏器”,部署时则更接近能力的“容器”。

也就是说,一个模型会不会写代码,取决于它接触过什么代码数据,也取决于训练系统能不能判断答案是否正确。

比如Coding之所以较早出现明显突破,是因为代码可以被大量制造,写完以后还能直接运行。
结果对不对,很快就能验证。

但机器人面对的环境完全不同。
一个机械臂没有抓稳杯子,可能是视觉判断出了问题,也可能是力度不合适。硬件本身的误差,也会改变最终结果。

这些失败很难只靠屏幕里的数据解释,研究人员必须回到真实环境里,去采集包含物理交互的数据。这些数据才包含真实物理世界的知识,能让机器人在物理环境行动自如。
这才是具身智能真正费时间的地方。

我们平时看到的演示视频,展示的是机器人成功的那一次。但冰山下大量需要采集、筛选、标注、验证的数据,才是支撑起整个模型能力的关键所在。

4
聊到这里,就能理解王潜为什么不太担心所谓的降维打击了。
如果OpenAI或Anthropic真的决定深入机器人领域,它们同样需要采集现实世界的数据,也要建设仿真环境和实机评测体系。

它们还得面对硬件问题。
机械臂的关节精度不同,摄像头位置也会改变模型得到的信息。一个在实验室里跑通的动作,换到另一台设备上可能就会失败。

这些难度不会因为公司已经拥有强大的语言模型而自动消失,因为语言模型对解决这些问题毫无经验。

如果一家基础模型公司开始建设机器人数据工厂,并且长期做实机验证,它其实也在逐渐变成一家具身智能公司。

王潜没有否认通用大模型的进步,也没有把Astra简单当成一个威胁。相反,他把问题重新放回了具身智能最核心的环节:谁能建立更有效的机器人数据闭环?

大模型可以带来更好的语言理解,也会改善视觉和常识能力,这些都是有价值的增益。
但要部署到实机上,机器人还需要快速完成动作推理,还需要考虑模型部署成本问题。
行业专用的具身模型可以围绕这些条件做更深入的优化,表现远远高于大语言模型。

它不需要承担语言模型的全部能力,反而可能更轻,也更适合进入机械臂的控制系统。具身模型与大语言模型不是“对手”,更像是承担了不同的角色。

5
所以,Astra的出现,具身智能公司未必是坏消息。
恰恰相反,它验证了王潜一直坚持的方向:预训练在机器人领域同样有效,通用数据也能成为机器人能力的增益。

具身智能行业那些肯踏踏实实做预训练的公司,今天恰恰也在往预训练部分加入通用数据。
它们与Astra,更像是一场“双向奔赴”。

GPT-6擅长理解任务,不代表它适合直接部署在机器人上。真实的动作控制需要更快的推理速度,也要适应不同的硬件环境。

这正是具身智能模型的优势。
它不需要承担通用大模型的全部能力,可以专注于机器人数据和动作控制,在实机上实现更高效的部署。

这也是为什么王潜认为,两条路线最终的能力上限,未必会出现特别明显的差距。
只要具身智能公司继续坚持预训练,同时把机器人数据和验证体系做好,它们并不会因为通用模型更大,就天然落后。

反过来,如果OpenAI和Anthropic想继续提升机器人的精细操作能力,它们仍然要进入现实世界采集数据,也要围绕硬件完成部署。

GPT-6证明了机器人预训练是有效的,但机器人最后比的,还是谁能在现实世界里稳定地把事情做成。

发布于 上海