Enid生活家
26-09-06 00:17 微博认证:数码博主

比亚迪汽车新技术研究院 AI 团队上个月发表了其首篇研究论文,介绍了一种用于自动驾驶的混合世界模型 HyWorldVLA。该模型结合了像素级和潜在空间世界建模,并采用视觉-语言-动作(VLA)架构。
该模型在自动驾驶公开基准测试 NAVSIM v1 中取得了 90.59 的 PDMS 评分,刷新了该基准的历史最佳成绩。在指标更全面的 NAVSIM v2 上,HyWorldVLA 同样取得了 89.71 分的领先成绩。
IT之家注:PDMS 指标综合考察碰撞安全性、可行驶区域合规性、安全距离、目标完成度和运动舒适性等多维度实际驾驶质量。
HyWorldVLA 的核心思路是“两条腿走路”。像素级世界模型逐帧预测未来路况,细节丰富但计算昂贵、对视觉噪声敏感;潜在空间模型在压缩的抽象表征中运行,效率高却容易丢失关键细节。比亚迪的方案在训练阶段用像素级监督充当“看门狗”,强制潜在空间保留足够的环境信息,实际推理时则只用轻量的潜在空间模型保证效率。#周深音乐节上墙头醋瘾大发#

发布于 广东