Navis-慢点评测
25-08-02 08:53 微博认证:汽车博主 头条文章作者

小鹏这篇 NavigScene 的论文值得一看。

它解释了为什么目前的辅助驾驶没有人类的「远见」,导航明明提示前方路口要转弯,但辅助驾驶就是不知道要提前变道。

之所以有这个问题,主要就在于去高精地图之后,辅助驾驶从导航得到的信息还不如人多,只能处理好「局部感知规划」,没有办法做到「全局路线导航」。

举个例子:

人类开车不仅仅靠眼睛看路,更依赖导航软件等「超视距」信息,比如导航会告诉你 「150米后有路口,提前变道」,或者是前方 「400米掉头」,人就能提前规划。

但是目前主流的辅助驾驶都只能处理处理近距离感知,缺乏对全局路线的主动感知,只能感知看到了,才能相应改变路径规划。

那么,这么重要的「超视距导航信息」,为什么一直都没呗辅助驾驶融合呢?

目前行业普遍存在两大难题:一是数据集与模型设计只关注局部感知而忽略全局导航;二是多模态融合难度大,视觉语言理解与驾驶决策之间难以协同。

所以 NavigScene 做的第一件事情,就是打破数据壁垒。

它把传感器数据和导航信息一一配对,生成了一套结构化的、自然语言表达的导航数据集。

数据来源覆盖真实驾驶数据集nuScenes与仿真数据集NAVSIM,实现了多样化测试环境。

利用Google Maps API等真实导航接口,自动生成从「起点」到「终点」沿途的每一段导航指令

设计精细的自然语言提示词,让AI更好地理解「何时变道」「何处转弯」「路口距离」等超视距关键信息,模拟人类司机使用导航、结合路况预判的真实经验。

然后进行了三大模型创新:

1️⃣导航引导式推理(Navigation-guided Reasoning)

它会吧「多视角图像/视频 + 自然语言导航指令 + 提问」拼接成模型输入,让 VLM 在回答任务时同时参考本地感知与全局导航,显著提升变道的决策质量。

2️⃣导航引导式偏好优化(Navigation-guided Preference Optimization, NPO)。

在 NSFT(Supervised Fine-Tuning)后,进一步采用强化学习框架扩展 Direct Preference Optimization(DPO)。加入「导航相关信息摘要」辅助任务,使奖励模型在生成简洁答案时更关注导航关键信息,提高模型对新场景的泛化能力。

3️⃣导航引导式视觉-语言-行动一体化模型(NVLA)。

将后训练好的 VLM 输出(高维词汇概率)通过 Sparsity Reduction MLP 压缩,再与 BEV(Bird’s-Eye-View)特征融合。融合后由感知、预测、规划子网络输出最终驾驶决策,确保在开环与闭环评测中均有明显性能提升。

最终实现了:

引入 NavigScene 后,各项语言生成指标(BLEU-4、METEOR、CIDEr、ROUGE_L、SPICE、GPT 评分)和完备性均有 5–15% 提升。

开环规划(nuScenes):与 SparseDrive、VAD 基线相比,平均 L2 误差降低 ≈20–30%,碰撞率下降 ≈30–50%。

闭环评测(NAVSIM):不发生责任碰撞率(NC)、可行驶区域合规率(DAC)和预测驾驶员模型得分(PDMS)大幅提升,驾驶行为更贴近人类。

跨城泛化:Boston⇄Singapore 零样本迁移场景下,引入 NPO 后 L2 误差平均下降约 15%,碰撞率降低约 10%。

期待小鹏的 VLA 表现[嘻嘻]

发布于 广东