刘雅文Arwen
26-08-31 13:14 微博认证:汽车博主 微博原创视频博主

#小鹏第二代vla首次模型重大升级#

我试着收拢收拢,小鹏第二代VLA分享会,想强调的核心能力
——长时序推演。给模型增加时空理解能力。

智驾发展到现在,无论是VLA也好,还是世界模型也好,都在解决这个问题

举个例子,一台贴着车道线行驶的车。它可能只是方向没扶稳,也可能准备加塞。只看这一瞬间,你是分不清楚它的意图的;只有把过去几秒的轨迹连起来,才能判断它是在随机摆动,还是持续向旁边偏移。

再比如,前段时间很火的一端特斯拉无故刹车后,突然前方出现一个小孩子的视频。
几秒前你看到一个孩子跑到车后面,此刻摄像头里已经看不到人了。但特斯拉在进入路口后,还是选择刹了车,这就是生物本能的,长时序时空推理能力。
就好比人类司机,看到这类场景,会提前收油,因为他记得刚才发生过什么,也知道接下来可能发生什么。

长时序推演解决的,是“事情为什么变成这样,接下来可能发生什么”。
智驾想从“看见危险再处理”,进化到像老司机一样提前收油、预留空间,就必须记得过去、理解现在,再推演未来。
这也是小鹏第二代VLA本次升级的核心。

为了做好长时序推演,小鹏首先引入了Infini-VLA长时序架构,让模型拥有最长30秒的有效记忆。这里的“记忆”,不是简单保存录像,而是让车辆、行人此前的运动状态,继续参与当前决策。
有了记忆,还要能够及时思考。小鹏加入流式自回归推理,让模型从过去“看完、算完、再行动”,变成边看、边想、边行动,端到端响应速度提升300%。

再往后,是预测。
X-Foresight预测式世界模型,可以推演未来6秒内交通环境可能发生的变化;Flow Matching轨迹生成,则让模型从单一确定性走向多解,再从中生成更自然的行动轨迹。

同时,小鹏通过MoT混合架构,把城区道路、园区、泊车等不同问题交给不同“专家”,减少任务之间的干扰;端侧模型参数量扩大3.5倍,提升复杂任务的建模和泛化能力。

这几项技术放在一起,构成一条完整链路:记住过去30秒,持续理解当下,推演未来6秒,再生成当前动作。

它带来的变化,不一定是多出几个功能(如语音靠边停车、语音控制就近泊入等),而是车辆的判断更连贯。比如面对遮挡时更早留出余量,窄路会车减少左右试探,处理加塞和横穿时,不必等风险完全出现再突然反应。
小鹏第二代VLA全新版本将在9月面向所有Ultra及Ultra SE车型开启推送,并由小鹏G9L首发搭载。面向较低算力平台的VLA 2.0 Lite蒸馏版,也将在9月开启首批推送,由G9L Max首发。

9月3日,特斯拉也将在奥斯汀举办Cybercab发布活动。真正走向无人驾驶以后,车辆没有人类随时替它补充判断,能否连续理解过去、现在和未来,只会变得更加重要。

长时序推演的重要性,不只属于高阶智驾。
对于具身机器人,这项能力甚至更重要。
机器人完成一项任务,往往要经历几十秒甚至几分钟。它需要记住用户最初的指令、自己已经做过哪些动作、物体的位置发生了什么变化,再决定下一步做什么。

所以,小鹏希望把同一套物理AI基座,从汽车和Robotaxi,继续向机器人、飞行汽车等更多本体延展。
它们面对的,其实是同一个问题:如何让AI在不断变化的物理世界里,持续理解,并连续行动。

总的来说
过去,智驾竞争更多比谁看得远、识别得准、反应得快。
接下来就进入到长时序推理的竞争了,看谁记得更久、想得更远。

#小鹏汽车[超话]#

发布于 上海