告别“撞大运”:从小鹏刘先明内部演讲解析VLA2.0的四大核心壁垒
在行业陷入“端到端、VLA等公关战的泥潭时,小鹏汽车自动驾驶负责人刘先明的一段5分钟内部演讲,向外透传了极度冷静的工程理性。他撕开了大模型时代“套壳开源”的遮羞布,直指决定智驾企业生死的四大核心命脉。
一、 告别“游击战”:用重资产基建终结“撞大运”式研发
早期的算法突破带有强烈的“炼丹”色彩,但自动驾驶面对真实路况的严苛容错率,决不允许出现“今天发个版本,明天交不出东西”的窘境。随着端到端大模型架构的推进,目前的训练数据量已达到恐怖的50PB级别。面对如此庞大的数据洪流,依靠旧有技术架构无异于用马车拉高铁。
因此,在即将发布“620”版本期间,团队做出了极具魄力的决定:对底层技术基础设施再次进行大换血。这不仅是对现有数据飞轮的支撑,更是提前为后续系统迭代做好底层算力和存储的扩容准备。这传递出一个明确信号:智能驾驶的竞争早已从单纯的“算法精妙度”演变为了“AI Infra(人工智能基础设施)的工程碾压”。没有底层的钢铁长城,再宏大的AI愿景也只能是空中楼阁。
二、 戳破“自研”泡沫:受限物理世界里的基座模型壁垒
当前,拿着开源大模型(如Llama、千问等)压缩参数,包装成“车端自研基座模型”的速成套路在行业内屡见不鲜。刘先明对此直言不讳:“你今天开始做,两三个月就能抄出来,但想让它真正Work,真的非常难。”
根本原因在于物理世界的复杂性与车端硬件的局限性。车端不可能像云端那样无限制堆叠算力集群,必须在严苛的功耗、散热和内存限制下爆发出极高的推理精度与毫秒级的实时性。同时,如何在海量多模态数据中甄别并剔除那些可能导致车辆失控的“被投毒”数据?这要求企业必须摒弃“拿来主义”,从零开始针对自动驾驶场景原生构建基座模型。这绝非几个月能速成的,而是维持身位优势的绝对技术壁垒。
三、 软硬解耦与极致压榨:定制芯片与重写的编译器
传统的软硬件协同往往陷入僵局:底层买供应商芯片,中间套第三方软件,上层跑自身算法。一旦模型跑不快,各部门必然互相甩锅。为剥离营销水分、维持科学严谨的测算,在对自动驾驶底层算力进行技术推演时,我们通常将AI芯片的有效利用率死死锚定在88%-92%这一工程理性的极限区间。
要真正在未来的图灵芯片等定制化硅片上跑到如此极致的真实利用率与高帧率,小鹏给出的终极杀招是:打通底层硬件与上层模型的任督二脉,重写编译器。
他们是国内极少数能把基座模型在定制化芯片上跑到极高帧率的玩家。通过将所有软硬件协同工作转化为“数据驱动的、可微分的优化过程”,编译器不再是死板的翻译工具,而是向上完美适配模型需求的动态桥梁。芯片、编译器和算法团队基于统一的误差精度KPI协同作战,让系统通过海量数据反馈自动逼近最优解,彻底消灭了跨部门协作的“灰色地带”。
四、 跨越迭代陷阱:决定生死时速的全自动仿真评测
#小鹏汽车[超话]#
当算力和算法不再是绝对瓶颈时,制约系统进化的最大阻碍是什么?刘先明的答案直击灵魂:“我现在的模型训练速度提升了70%,两三天就能练完一个模型。但是我发现,测不了。”
如果前端模型训练极快,而后端评测依然只能依赖人工上路盲测,整个研发链路会被死死卡住。工程师不知道这一版模型是变聪明了还是变蠢了,自然失去下一步的优化方向。因此,构建全自动化的仿真与评测体系(X-World、X-Caxhe,据说还有新技术),其战略地位丝毫不亚于训练本身。只有评测速度超越训练速度,形成“高频训练—快速评测—精准反馈”的无缝闭环,数据飞轮才能真正高速运转,打破迭代停滞的陷阱。
总结:技术底色决定长期价值厚度
这五分钟的内部复盘,展现的是小鹏对底层工程逻辑的绝对敬畏。应对50PB数据的重资产基建、原生的场景基座模型、重构编译器带来的极限算力压榨,以及全自动化的仿真评测体系,这四大引擎构筑了端到端、大模型智能驾驶时代的深厚护城河。这种冷酷的工程理性,不仅剥离了市场的浮躁,为物理AI的全面落地铺平了道路,更凸显了其作为核心科技资产的长期配置价值。
感谢狮子头提供的视频!🙏🏻 http://t.cn/ELT0hke http://t.cn/AXieescr
发布于 日本
