甜草莓的科学小屋
26-04-15 23:24 微博认证:南方科技大学副研究员

看到“具身智能目前的发展缓慢 是受限于硬件还是软件?”来简单聊几句。
当前具身智能的发展,主要受限于软件;但如果看大规模落地,最终更受限于硬件。

先直接回答为什么不是简单选一边。因为这个问题其实包含两个不同层面。

第一个层面是机器人能不能学会做事,这里重点是感知、理解、规划、控制和泛化能力。

第二个层面是机器人能不能稳定、低成本地长期做事,这里重点是执行器、传感器、功耗、可靠性、寿命和维护成本。

前者主要是软件问题,后者主要是硬件问题。

如果只看这两三年的技术进展,我认为软件是更突出的瓶颈。原因很简单:现在机器人的难点,已经不是让它完成单个动作,而是让它在复杂环境里持续正确地完成任务。这里真正卡住行业的,不是“手臂抬不起来”,而是这几个更基础的问题还没有解决好:机器人能不能正确理解场景,能不能把任务拆解成可执行步骤,能不能在环境变化后继续完成任务,能不能在失败后恢复,能不能把一个场景里学到的能力迁移到另一个场景。

这就是为什么现在行业最关注的是具身推理、空间理解、多模态感知、任务规划、视觉—语言—动作模型,而不是某一种新的机械结构突然改变了全局。因为目前最缺的不是能动,而是知道什么时候该怎么动,并且换个环境还能继续动对。

再往下看,软件瓶颈的核心还不是模型结构本身,而是数据问题。

具身智能和语言模型最大的区别是:语言模型训练数据天然存在于互联网,机器人训练数据天然不存在。机器人需要的不是普通图像和文本,而是带动作轨迹、接触反馈、任务目标和成败标记的交互数据。这类数据很难采、很贵、标准不统一,而且强依赖具体机器人本体和具体场景。所以今天很多所谓软件瓶颈,本质上其实是真实世界数据不足、训练闭环不完整、泛化能力不够、仿真到现实迁移不稳定。

这也是为什么现在大家一边做机器人基础模型,一边又在做高保真仿真、合成数据、世界模型和 sim-to-real。因为如果真机数据足够便宜、足够多、足够容易迁移,这些方向不会这么重要。恰恰是因为真实训练成本太高,行业才不得不想办法用仿真和生成式方法补这一段。换句话说,当前具身智能最核心的研究难题,是软件系统还不能形成一个低成本、可扩展、可泛化的学习闭环。

但如果因此得出硬件不是问题,这个结论也站不住。因为一旦从研究走向产品,硬件约束就会迅速上升。

实验室里关注的是任务成功率和演示效果,产品里关注的是另外一套指标:连续运行时间、故障率、标定漂移、功耗、发热、续航、安全性、维护频率和单机成本。软件再强,也不能替代这些指标。机器人不是只输出答案,它要输出动作。只要输出动作,就一定受物理条件约束。

尤其在高难度操作任务里,硬件限制非常直接。比如灵巧手操作、双臂协同、装配、柔性物体处理、人机协作,这些任务不只是要求会规划,还要求本体本身具备足够的执行精度、触觉能力、力控能力和机械稳定性。如果执行器有回差,传感器不稳定,结构刚柔不合适,热管理做不好,那么上层模型再强,最终表现也会很差。软件可以提高上限,但不能完全弥补本体能力不足。

所以更准确的说法不是软件重要或者硬件重要,而是要分阶段看。

在研究阶段,主要瓶颈是软件。因为行业最缺的是泛化、数据闭环、任务理解和稳定控制。

在落地阶段,主要瓶颈是硬件。因为行业最终要面对的是成本、可靠性、寿命和维护。

在更长期的产业竞争里,真正决定胜负的,往往不是谁先做出一个更强的 demo,而是谁能把软硬件做成一个稳定、低成本、可复制的系统。

所以如果一定要用一句最简洁的话回答这个问题,我会这样说:今天具身智能做不好,主要是软件问题;未来具身智能做不大,主要是硬件问题。

再补一句更完整的判断:
当前行业最缺的是通用能力,所以软件是主瓶颈;但真正走向规模化时,硬件会成为更硬的约束,因为物理世界不接受只在 demo 里成立的智能。

这也是为什么我不太赞成把这个问题做成简单二选一。它不是软件还是硬件,而是不同发展阶段,主导瓶颈不同。现在看,软件更关键;以后看,硬件更关键;真正成熟时,拼的是两者能不能形成闭环。#具身智能#

发布于 河北