小鹏VLA2.0架构跃迁——从规则驱动到模型驱动(二) 拆掉“ Language” 墙
VLA2.0核心架构:拆掉“ Language” 墙,重塑“生理反射”
面对中端市场的强成本约束与高复杂环境,VLA 2.0 通过统一建模,彻底打破了传统模块化串联架构的链路损耗瓶颈。
统一建模(从识别走向理解):VLA 2.0 跨越了简单的“识别物体”,走向对物理关系的“深度理解”。它能精准预判场景背后的物理惯性(如预判横穿风险),并在无预设规则下自发处理“14秒路障停顿(电动知士测试场景)”等复杂长尾场景。
拆掉 Language(重构直觉响应):彻底取消“感知→翻译文字→决策查表”的显式中介,视觉信号直接映射为控制令牌。在车端大算力支持下,推理延迟从约 200ms 剧降至 80ms,为 120km/h 高速行驶凭空争取了约 4 米的紧急制动安全余量。语言则化为隐式语义(并未消除),与座舱共享底座。
算力与工程协同:软硬深度握手造就性能飞跃。单颗图灵芯片效能近 10 颗 Orin-X,基座编译效率提升 12 倍。这支撑系统完成了 1,360 公里单次无接管横跨中国的极限路测,并加速能力向存量车型下放。
竞争范式跃迁:摒弃依赖高精地图与规则兜底的渐进路线,小鹏确立了以 VLA 2.0 为“整车级多模态中枢”的纯视觉框架,筑起大规模扩展的极深护城河。
发布于 中国台湾
