一、数据缺口:从“百万小时”到“千万小时”的鸿沟
真实数据严重不足:中国信通院《具身智能训练场研究报告(2026年)》显示,当前全球可用的高质量真实数据仅为数十万至百万小时级。
临界点遥不可及:具身基础模型要迎来“ChatGPT”时刻,至少需要数千万小时数据支撑,当前缺口超过99%。
与LLM的本质差异:大语言模型消耗了人类五千年文字知识,而肢体交互数据采集难度更高、量级近乎无限。
二、涌现门槛:数据积累的“质变”拐点
量级估算:有观点认为实现具身AI能力突破需约1000亿小时数据,而当前全球高质量真实物理交互数据仅约50万小时,缺口超过99.999%。
非结构化难题:具身数据不仅是“时长”问题,更关键的是场景、动作、反馈的多元组合——人类每日新生场景和行为都会持续产生新数据,这决定了数据需求是动态增长的。
从语言到物理的跨越:与文本数据不同,物理交互数据必须通过真实或高保真仿真环境获取,采集速度受物理世界运行速度的硬约束。
三、窗口期判断:2到3年的战略机遇
行业共识:有分析指出,具身智能的窗口期最多2到3年甚至更短,之后行业分层将越来越明显。
数据护城河价值:在模型架构趋同的背景下,高质量数据正成为区分头部与追随者的核心壁垒——谁先跨过数据临界点,谁就能率先触发能力涌现。
从“堆参数”到“堆数据”:大模型发展已证明规模扩展的收益边界,具身智能的下一场竞争焦点正在转向数据采集效率与数据质量的组织能力。