最近视觉顶级顶会 CVPR 2026 论文入选结果出炉,理想汽车有 12篇 论文(含3篇Oral/Findings),涉及自动驾驶和具身智能的。这次的成果是从感知、规划、世界模型到语言大模型、轻量化部署的全栈系统性技术。
感知与决策:突破传统瓶颈
SparseWorld-TC(Oral入选): 这个全新架构打破了传统方法依赖鸟瞰图(BEV)和离散化token的瓶颈,直接从原始图像特征端到端预测多帧未来3D占据情况(Occupancy)。在nuScenes基准上刷到了SOTA(当前最优性能),未来时空轨迹预测精度极高。
SGDrive: 借鉴人类驾驶的层级认知,通过结构化时空表示,补齐了通用VLM(视觉语言模型)在驾驶场景的认知空缺,拿下了NAVSIM纯视觉方案SOTA。
强化学习与世界模型:安全与仿真的底座
PlannerRFT + nuMax仿真器: 解决了扩散模型规划器在强化微调时难以场景自适应的痛点。配合他们自研的nuMax仿真器(轨迹推演比原生nuPlan快10倍),大规模并行学习的基建稳了。
AD-R1(Findings): 直面端到端降本增效的“致命问题”——世界模型往往过于“系统性乐观”(只学专家数据,不会预判危险)。AD-R1引入了反事实合成流水线,作为危险感知评论器,大幅降低了闭环仿真中的违规率。
InfiniDepth & Unposed-to-3D: 前者将深度建模为神经隐式场,支持任意分辨率连续查询;后者实现了无位姿图像的自监督学习,直接从真实图像重建出3D车辆资产,仿真渲染门槛大打折扣。
大模型端侧部署与对齐:更准、更快、更轻
FastMMoE(Findings): 针对多模态MoE架构的无需重新训练的加速框架。在DeepSeek-VL2等模型上验证,最高削减55%的浮点运算量,却保留了95.5%的原始性能。
LinkVLA & CogDriver: 解决大模型决策抖动和推理延迟。LinkVLA采用粗到细两步解码,直接砍掉86%的推理延迟;CogDriver引入认知惯性机制,驾驶得分直接提升22%。
Switch-KD(Findings): 跨模态知识新蒸馏范式,直接重构底层逻辑,让0.5B的小模型拥有逼近1.5B模型的多模态理解力,车端边缘计算和智能座舱的福音。
这里还提到,理想在基础研究上的高强度投入(连续5个季度研发投入30亿左右,2025年全年113亿)将迎来系统性井喷。从早期的应用层创新,到如今深耕具身智能的底层学术与工程双向反馈,产学研结合。
下半场,感觉还是会回到 AI 技术创新改变硬件的领域上来。[并不简单] #理想汽车##CVPR##具身智能##物理AI#
