大懒货
26-08-31 14:18 微博认证:浙江大学心理学博士

最近又回顾了下理想被 CVPR 2025 收录的一篇文章:《DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation》

🔗论文链接:http://t.cn/AX0ZOlNo

大致意思就是传统开环评测通常是拿一段真实录像给智驾模型,模型输出轨迹,但环境不会因为模型的动作发生变化。这样能评估感知、规划是否接近参考答案,但很难测试真正的连续决策。DrivingSphere 做的是一个高保真闭环环境:模型输出动作以后,虚拟世界会更新,再重新生成下一时刻的视觉输入

它的技术结构大概可以理解成三层:
1️⃣第一层是先搭世界。不是直接用视频生成模型“画下一帧”,而是构建一个带时间维度的 4D Occupancy 世界,把静态道路、建筑,以及车辆等动态物体放进统一空间表达里。这个空间表达是后续所有生成和交互的“骨架”

2️⃣第二层是把世界渲染成智驾真正能看的画面。它再用 Visual Scene Synthesis,把 4D 世界转换成高保真、多摄像头、时间连续的视频。这点很关键,因为现在很多端到端/VLA 智驾最终吃的仍然是视觉传感器输入

3️⃣第三层才是真正的闭环:模型看画面 → 输出轨迹/控制 → Ego 位置改变 → 周围交通环境变化 → 世界重新更新 → 再生成新的视觉输入

它是先有一个明确的 4D 空间世界,再基于这个世界生成视觉结果。这样车道线、车辆距离、遮挡关系、道路拓扑这些几何和时空关系,会有一个相对稳定的锚点,不然完全依赖视频生成,自动驾驶这种场景很容易出问题

今天前车离你 10 米,下一帧偷偷变成 8 米;车道线位置漂了一点;遮挡关系变了;
对于普通视频可能看不出来,对于智驾测试来说,这些误差都会直接影响决策

所以这套思路本身是很 make sense 的本质上是在搭一个智驾模型可以真正“进去开车”的虚拟世界:模型做决策,世界给反馈,模型继续决策。犯错可以复现,极端场景可以重复测试,最后把智驾评测从【做题】慢慢变成【实战】
#理想汽车##懒博小课堂##大v聊车#

发布于 浙江