理想TOP2
26-08-25 16:39 微博认证:AI博主

WAM的风还是吹到了自驾,理想最新的BrainWAM解析
原文来自自动驾驶之心
2026年8月13日,arXiv 上挂出一篇叫 BrainWAM 的论文,中科院自动化所和理想汽车合作,WAM的火还是烧到了自驾啊。

论文标题是:BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving。

主打 NAVSIM v1 的 89.5 PDMS 和 v2 的 89.6 EPDMS,两个 SOTA。

但我看完全文,认为值得大家看的地方倒不是实验结果。正文里面有一个失败的实验:把 VLM、视频生成模型、动作三种 token 都纳入到同一个 attention 空间联合训练,结果是 87.8 PDMS。比只用世界模型的 88.1 还低。

加了 VLM 进去,性能掉了 0.3 分。

这个结果可能有一定的指引作用,值得所有正在做 VLA 和世界模型融合的同学看一下。

图1
最直觉的做法,是错的
当前业内的技术背景是这样。

除了基于感知的一段式端到端,大范式下还有两个流派:

VLA(Vision-Language-Action)寄希望于视觉语言模型的世界知识,擅长把观测接到路线指令、交通规则和高层驾驶意图上。像理想、元戎、小鹏、英伟达大框架下都是这种范式。

WAM(World Action Model)是比较新的方案,学的是「动作和未来状态如何一起改变」,提供运动趋势、交互结果和物理可行性。它知道你这么打方向盘之后世界会变成什么样。短板是规则接地和意图推理弱。

一个能搞定「该怎么开」,另一个搞定「这么开之后会怎样」。两者融合是很自然的想法。

最直接的做法,论文里叫 Tri-MoT:VLM token、视频生成模型(VGM)token、action token,三种一起丢进共享的 attention 空间,让它们自由交互。这也是多模态融合里最标准的做法。

结果就是我们上面说的结果,在消融实验里:

图2

VLA 单干 86.1,世界模型单干 88.1。两个融合起来,87.8。

VLA 本身加世界模型效果是提升了的。换句话说,问题不在于 VLM 没用——VLA only也有 86.1。问题在于,这两样东西在融合在一起可能会互斥,而且世界模型输了。

action token 走了捷径,因为 VLM 的信号更好学
BrainWAM 接下来做的事情很朴素:既然性能下降,那就去看 action token 到底在注意谁。

论文的图2,横轴是 Transformer 的层数,纵轴是 action token 对 VLM token 的注意力与对 VGM token 的注意力之比。结论一眼可见:在绝大多数层里这个比值都大于 1,浅层尤其夸张,峰值接近 5 倍。

图3

他们给这个现象起了个名字,attention-allocation mismatch,注意力分配失配。

原因在于:VLM token 是干净的、语义紧凑的、容易学的;而 VGM token 在这个时刻还在去噪过程中,提供的是低信噪比的特征。

简单来说,action token 面前有两份材料,一份是整理好的会议纪要,一份是还在转录中、满是错字的录音稿。它当然优先看前者。于是模型学会了走 VLM 这条捷径,把真正提供预测动力学的信号丢失了。

做多模态训练的同学对问题应该不陌生,这就是模态竞争(modality competition)的经典形态。

问题发现之后,解决的方向就可以尝试了。

左脑右脑各干各的,只在动作这一层握手

图4

BrainWAM 的做法是让两条通路各自专门化,只在压缩后的 action 表征上通信。BrainWAM 借了神经科学的隐喻来讲这套结构:

图5

隐喻好读,具体来说有三个优化的地方,大家感兴趣的可以看看原文。

1. CAB 的门是零初始化的。

2. Dual-MoT:共享 self-attention,但 FFN 是模态专属的。

3. 视频流和动作流用各自独立的 rectified-flow 时间步。

训练时冻结两个分支
BrainWAM 的训练分三阶段:

阶段一:单独训 WAM 分支,视频重建损失 + 动作损失
阶段二:单独训 VLA 分支,动作损失
阶段三:冻结上面两个分支,只优化 CAB、CIF 和最终的 action decoder
实验配置:8 卡 H20,每阶段 100K steps,per-GPU batch size 6,AdamW + cosine 调度,200 步 warmup,峰值学习率 5e-5,bf16 混合精度,每 3K steps 存一次 checkpoint。

冻结的好处是:保住两个 backbone 的预训练能力,把学习目标压缩到「怎么协调」这件事上,训练稳定,成本也低得多。对于一个想复现或者想在自家 backbone 上试的团队,这是相当友好的设计。

但感觉也是没有办法的办法,估计是联合训练不收敛。

图6

实验结果

图7
图8
图9
图10

写在最后
这篇论文的贡献结构,我觉得是倒挂的。

论文里的SOTA,领先幅度分别是 0.4 分和 0.9 分,而作者自己也承认部分指标已接近饱和。

所以WAM架构层面能带来的性能提升有多少,可能还要打个问号。

创新层面倒没什么问题,毕竟WAM本身和自动驾驶结合,这方面的探索还是比较少。

#理想汽车##理想汽车[超话]#

发布于 四川