电动知士大雨
26-08-28 07:56 微博认证:汽车博主

小鹏第二代VLA全新版本体验日,刘先明回答了:物理世界AI,如何真正落到自动驾驶上。

要让模型把车开好,有两项能力必须同时提升:

看得更久。模型需要利用更长的上下文和时序信息,理解一个场景的变化。
反应更快。道路环境始终在变化,模型不能等一轮计算结束后再采取行动。

更长的时序意味着更多视觉信息和更大的计算压力;更快的反应,则对推理时延提出了更高要求。但车端算力、内存、功耗和散热都是有限的,无法像云端一样持续扩展。

小鹏团队给出了自己的解法:从底层重构模型架构,并结合软硬件协同优化,在有限的车端算力下,同时实现更长的记忆、更连续的推理和更远的预测。

记忆更长:Infini-VLA将最长30秒的有效历史信息带入当前决策。他们没有把30秒视频简单堆进模型,而是让模型持续保留与驾驶任务相关的历史信息,避免每次判断都重新处理全部上下文。

反应更快:Streaming Inference流式自回归推理,把“看、想、行动”变成一个持续进行的过程。模型可以边接收新的信息输入,边更新输出动作,不必等待完整一轮推理结束。官方给出的数据是,端到端响应速度提升300%。

在这两项能力之上,小鹏还加入了对未来的预测。

X-Foresight预测式世界模型可以推演未来6秒内交通参与者和道路环境的多种可能变化;
Flow Matching则帮助模型从单一确定性预测走向多种可能,使生成的驾驶轨迹更加自然、拟人。

此外,新版本还引入了MoT混合架构,根据城区道路、园区、泊车等不同任务动态分配模型能力,减少不同场景之间的任务干扰,让模型在场景切换时保持更稳定的表现,在场景切换时,依旧记得之前发生了什么。

在有限的车端算力下,如何让模型记得更久、反应更快、想得更远。这就是小鹏的解法,这些能力也构成了6.3.0版本的技术基础。

至于它在真实道路上的表现,大家可以等等我们的节目。

#小鹏第二代VLA首次模型重大升级#

发布于 广东