WAM的风还是吹到了自驾,理想最新的BrainWAM解析
原文来自自动驾驶之心
2026年8月13日,arXiv 上挂出一篇叫 BrainWAM 的论文,中科院自动化所和理想汽车合作,WAM的火还是烧到了自驾啊。
论文标题是:BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving。
主打 NAVSIM v1 的 89.5 PDMS 和 v2 的 89.6 EPDMS,两个 SOTA。
但我看完全文,认为值得大家看的地方倒不是实验结果。正文里面有一个失败的实验:把 VLM、视频生成模型、动作三种 token 都纳入到同一个 attention 空间联合训练,结果是 87.8 PDMS。比只用世界模型的 88.1 还低。
加了 VLM 进去,性能掉了 0.3 分。
这个结果可能有一定的指引作用,值得所有正在做 VLA 和世界模型融合的同学看一下。
图1
最直觉的做法,是错的
当前业内的技术背景是这样。
除了基于感知的一段式端到端,大范式下还有两个流派:
VLA(Vision-Language-Action)寄希望于视觉语言模型的世界知识,擅长把观测接到路线指令、交通规则和高层驾驶意图上。像理想、元戎、小鹏、英伟达大框架下都是这种范式。
WAM(World Action Model)是比较新的方案,学的是「动作和未来状态如何一起改变」,提供运动趋势、交互结果和物理可行性。它知道你这么打方向盘之后世界会变成什么样。短板是规则接地和意图推理弱。
一个能搞定「该怎么开」,另一个搞定「这么开之后会怎样」。两者融合是很自然的想法。
最直接的做法,论文里叫 Tri-MoT:VLM token、视频生成模型(VGM)token、action token,三种一起丢进共享的 attention 空间,让它们自由交互。这也是多模态融合里最标准的做法。
结果就是我们上面说的结果,在消融实验里:
图2
VLA 单干 86.1,世界模型单干 88.1。两个融合起来,87.8。
VLA 本身加世界模型效果是提升了的。换句话说,问题不在于 VLM 没用——VLA only也有 86.1。问题在于,这两样东西在融合在一起可能会互斥,而且世界模型输了。
action token 走了捷径,因为 VLM 的信号更好学
BrainWAM 接下来做的事情很朴素:既然性能下降,那就去看 action token 到底在注意谁。
论文的图2,横轴是 Transformer 的层数,纵轴是 action token 对 VLM token 的注意力与对 VGM token 的注意力之比。结论一眼可见:在绝大多数层里这个比值都大于 1,浅层尤其夸张,峰值接近 5 倍。
图3
他们给这个现象起了个名字,attention-allocation mismatch,注意力分配失配。
原因在于:VLM token 是干净的、语义紧凑的、容易学的;而 VGM token 在这个时刻还在去噪过程中,提供的是低信噪比的特征。
简单来说,action token 面前有两份材料,一份是整理好的会议纪要,一份是还在转录中、满是错字的录音稿。它当然优先看前者。于是模型学会了走 VLM 这条捷径,把真正提供预测动力学的信号丢失了。
做多模态训练的同学对问题应该不陌生,这就是模态竞争(modality competition)的经典形态。
问题发现之后,解决的方向就可以尝试了。
左脑右脑各干各的,只在动作这一层握手
图4
BrainWAM 的做法是让两条通路各自专门化,只在压缩后的 action 表征上通信。BrainWAM 借了神经科学的隐喻来讲这套结构:
图5
隐喻好读,具体来说有三个优化的地方,大家感兴趣的可以看看原文。
1. CAB 的门是零初始化的。
2. Dual-MoT:共享 self-attention,但 FFN 是模态专属的。
3. 视频流和动作流用各自独立的 rectified-flow 时间步。
训练时冻结两个分支
BrainWAM 的训练分三阶段:
阶段一:单独训 WAM 分支,视频重建损失 + 动作损失
阶段二:单独训 VLA 分支,动作损失
阶段三:冻结上面两个分支,只优化 CAB、CIF 和最终的 action decoder
实验配置:8 卡 H20,每阶段 100K steps,per-GPU batch size 6,AdamW + cosine 调度,200 步 warmup,峰值学习率 5e-5,bf16 混合精度,每 3K steps 存一次 checkpoint。
冻结的好处是:保住两个 backbone 的预训练能力,把学习目标压缩到「怎么协调」这件事上,训练稳定,成本也低得多。对于一个想复现或者想在自家 backbone 上试的团队,这是相当友好的设计。
但感觉也是没有办法的办法,估计是联合训练不收敛。
图6
实验结果
图7
图8
图9
图10
写在最后
这篇论文的贡献结构,我觉得是倒挂的。
论文里的SOTA,领先幅度分别是 0.4 分和 0.9 分,而作者自己也承认部分指标已接近饱和。
所以WAM架构层面能带来的性能提升有多少,可能还要打个问号。
创新层面倒没什么问题,毕竟WAM本身和自动驾驶结合,这方面的探索还是比较少。
#理想汽车##理想汽车[超话]#
