小鹏AI战略:当汽车开始「思考」
为什么蔚来、小鹏、理想这三家都走上了自研芯片之路,以及他们如何走出了三条截然不同的路。
小鹏如何用端到端大模型重新定义智驾,以及图灵芯片如何成为这场AI革命的算力底座。
一、为什么「规则」走到了尽头
2024年10月,小鹏1024科技日上,何小鹏说了一句话:“未来10年,将是AI的10年。AI将重塑一切行业,包括汽车。”
这句话如果放在2019年说,大多数人会觉得是营销话术。但放在2024年,它已经有了足够多的证据,端到端大模型正在让汽车真正学会「思考」,而不再只是执行人类写好的指令。
理解这个转变,需要先理解传统智驾为什么正在失效。
规则驱动的天花板
传统自动驾驶系统,建立在“规则驱动”的逻辑之上。工程师手写10万条以上的规则,告诉系统在遇到什么情况时应该怎么处理:
• 前方车辆距离小于50米且相对速度大于阈值 → 减速
• 前方检测到行人且在穿越路径上 → 停车
• 遇到红灯 → 停车
• 车道线不清晰超过3秒 → 保持当前车道
这套系统在简单场景下表现稳定,高速公路、标线清晰的道路,它能处理得很好。但它的致命弱点是:现实世界的场景是无限的,规则永远写不完。
中国的道路场景尤其复杂。
电动车随意穿行、行人横穿马路、道路施工、标线不清晰、树叶遮挡摄像头……这些被称为“corner case”的极端情况,是规则系统无法穷举的。工程师每发现一个边界场景,就需要补充一条规则,但旧规则的修改又可能引入新的冲突。
系统变得臃肿、脆弱,且边际效益递减。
这还不是最关键的。最关键的是:规则系统没有真正的“理解”能力。它不知道什么是“快递三轮车”,它只知道“检测到一个小型移动障碍物在非机动车道上”;它不知道“这里有学校要减速”,它只知道“前方有限速标识”。
它的所有决策都是条件反射,不是认知判断。
数据驱动的逻辑跳跃
端到端大模型,用“数据驱动”替代“规则驱动”。这不只是技术路线的切换,而是认知范式的根本转变。
传统系统的逻辑是:感知→规则→决策→控制。每个模块独立工作,模块之间靠接口传递结构化信息。信息每传递一次,就可能产生损耗;出了问题,定位是哪个环节的责任相对清晰,但模块之间的信息壁垒也限制了系统的上限。
端到端大模型的逻辑是:传感器输入→神经网络→驾驶决策。中间不再有规则引擎,AI直接学习从“看到什么”到“怎么开”之间的映射关系。
这种学习的本质,不是记忆具体的规则,而是涌现,AI从海量人类驾驶数据中,自己学会了处理复杂场景的能力。就像人类学开车,不是背交规条文,而是看别人怎么开,自己练着练着就会了。
开车的“感觉”,不是规则,是经验。
这个“感觉”,规则系统永远无法获得,但端到端大模型可以。
小鹏的端到端架构最初分为三个模块:
感知层:XNet(神经网络)
规划层:XPlanner(规控大模型)
认知层:XBrain(大语言模型)
动态XNet实时预测周围交通参与者的行为轨迹;静态XNet实时构建3D道路环境,摆脱高精地图的依赖;纯视觉2K占用网络构建可通行空间;感知范围覆盖1.8个足球场,可识别50种以上目标物。
基于神经网络的规划层,不再依赖工程师手写的规则,训练数据来自海量“五星司机”的驾驶行为,而AI则从数据中学到了「什么叫好的驾驶」。
理解复杂场景的宏观逻辑,识别待转区、潮汐车道、特殊路牌,在规则无法覆盖的场景下做出“更像人”的判断。
二、VLA:从单个模块到一个基座
端到端大模型的下一个问题,是架构本身的进化。
VLA的跨越
VLA在VLM基础上,引入直接的动作输出能力。将视觉感知、语言推理、动作控制三者统一在同一个模型框架内,实现从多模态输入到驾驶控制指令的完整闭环。
V不是重点,视觉感知已经相对成熟。
关键是L和A的融合,Language模块理解“这是什么场景,应该怎么做”,Action模块直接输出“方向盘转多少度、油门踩多深、刹车力度多少”。
这两者之间的跨越,比想象中更难。
传统VLA架构的工作流程是:视觉输入→视觉编码→语言理解→语言描述→动作解码→控制指令。其中“语言描述→动作解码”这个环节,需要把语言层的语义意图"翻译"成具体的动作参数。
这个翻译过程会损失信息,语言能表达“减速让行”,但表达不了“在0.3秒内线性减速到每小时15公里,同时方向盘微调2度避开右方自行车”这种精细控制。
小鹏VLA 2.0的突破,就在于去掉了中间的语言描述环节。
2025年11月,小鹏发布VLA 2.0,做了一个关键架构调整,Language模块的输出直接驱动Action模块,不再经过中间的语言描述层。
这个调整把系统响应时延从理论上的数百毫秒,压到了80毫秒以下,比人类司机的平均反应时间(约250毫秒)快了三倍。
这不是简单的工程优化,而是架构层面的重新设计。它要求Language模块和Action模块在训练阶段就深度耦合,不是“先分别训练再拼接”,而是“从第一天起就是同一个模型”。
这个统一带来的实际效果是:场景切换不再需要模型切换。
园区、地库、城区道路、高速公路,不同的驾驶场景,在VLA 2.0看来,只是输入数据不同,决策逻辑是同一套。
统一基座模型还带来了另一个好处:泛化能力大幅提升。
分模块系统的泛化能力受限于每个模块的能力短板,感知再好,规划跟不上也没用。统一基座让系统的泛化上限不再受制于单个模块,AI可以在更高维度上学习驾驶的本质逻辑,而不是在每个模块上分别逼近局部最优。
2026年5月20日,随小鹏GX上市,VLA 2.0推送6.2版本更新。新增了两项关键能力:园区/地库无导航漫游。
在完全没有导航地图的陌生停车场或园区,车辆可以自主寻径,找到出口。
这依赖的是VLA模型在无地图环境下的泛化能力,它不是靠记忆路线在开,而是真正“理解”了什么是停车场的结构和通行规则。
全场景原地起步。
无论在公开道路、园区还是地库,哪怕处于P档状态,也可以直接开启智驾——不需要先设置导航目的地,不需要在特定场景下才激活,系统直接进入驾驶就绪状态。
这两项能力,从“有路可走”升级到“无路也能走”,是VLA泛化能力的直接体现。
三、图灵芯片:让大模型跑在车上
VLA大模型对算力的需求,超出了通用芯片的能力边界。
通用芯片的瓶颈
端到端大模型的核心计算量,来自模型推理。VLA 2.0基座模型的参数规模,在720亿(72B)量级。这个规模的模型在云端运行毫无问题,但要在车端实时运行,通用芯片面临三重瓶颈:
第一、内存带宽不足。大模型推理是内存密集型任务——每次计算需要从内存中读取大量参数。通用芯片的内存带宽是按照通用计算场景设计的,不能满足大模型的带宽需求。
第二、有效算力利用率低。通用芯片在运行大模型时,实际能发挥的算力只有标称值的40%到50%。其余的算力消耗在数据搬运、格式转换等“无效”操作上。
第三、编译器不匹配。通用芯片的编译器是面向通用计算的,不理解大模型的计算图结构,无法做针对性优化。
结果是:用一个标称算力100TOPS的通用芯片跑VLA,实际效果可能只相当于30到40TOPS的有效算力。
图灵芯片的设计逻辑
图灵芯片,是小鹏为VLA大模型量身定制的专用芯片。
它不是通用算力的堆砌,而是针对大模型推理做了三个层面的优化:
内存带宽针对大模型重新设计。
720亿参数的大模型,每次推理需要频繁访问参数数据。图灵芯片的内存带宽是通用芯片的数倍,直接减少了“数据等计算”的等待时间。
软硬一体协同设计,芯片、编译器、模型,三者从定义阶段就一起设计,不是“芯片做完再移植算法”,而是“算法需要什么样的芯片,芯片就设计成什么样”。
这种深度协同让图灵芯片的有效算力利用率接近100%,标称算力是多少,实际能用就是多少。
推理效率针对VLA架构优化。 图灵芯片内置针对VLA计算图的专用加速单元,在视觉编码、语言推理、动作输出三个环节分别做加速,整体推理效率远超通用芯片。
图灵芯片不只是一颗车端推理芯片,它的设计目标同时覆盖了三个场景:汽车、机器人、飞行汽车。这三个场景都需要感知-决策-执行的核心能力,都需要端到端AI模型的算力支撑。这是小鹏区别于蔚来和理想的关键战略选择。
X-World:现实世界模拟器
车端芯片解决了“跑得快”的问题,但训练大模型需要的算力,远不是车端能承载的。
为什么需要世界模型
端到端大模型的核心能力,来自训练数据。但真实驾驶数据的采集,有两个无法回避的问题:
长尾场景的稀缺性。
日常驾驶数据随处可见,但“前方突然出现施工围挡且道路标线被覆盖”、“前方车辆急刹同时旁边电动车变道切入”这类复杂场景,在真实驾驶中出现的频率极低。靠自然采集,数据量远远不够。
Corner Case的验证难度。
当系统做出了一个重要决策——比如紧急变道避让——如何验证这个决策是对的?现实中无法回放,只能靠模拟。但传统的模拟环境(基于3D重建的场景)与真实世界的视觉分布存在差异,模型在模拟中表现好,在真实道路上不一定好。
世界模型,就是为了解决这两个问题而生的。
X-World的技术原理
小鹏在2026年4月发布了X-World世界模型的技术报告,核心功能是一个“可控的多视角生成式世界模型”,基于视频扩散技术,生成与真实世界视觉分布高度一致的驾驶场景。
它的输入是:多摄像头历史视频流+驾驶动作指令。
它的输出是:对应的未来多摄像头视频流。
换句话说,X-World可以“想象”未来,给定当前的驾驶状态和接下来的操作,它能生成接下来的驾驶场景画面。这个“想象”不是胡思乱想,而是遵循物理规律、符合真实世界视觉分布的生成。
基于这个能力,X-World支撑了小鹏智驾系统的三个核心场景:
闭环仿真测试。 在X-World中运行VLA 2.0模型,可以评估碰撞率、目标达成率、行驶舒适性等关键指标。与传统3D重建仿真不同,X-World生成的场景在视觉分布上与真实世界高度一致,测试结论更可信。
截至2026年,小鹏的仿真场景库从一年前的3万个扩展到50万个以上,每天的仿真测试里程相当于3000万公里真实驾驶。这个规模让长尾场景的测试覆盖成为可能。
在线强化学习。 X-World的可控性,让小鹏可以针对特定难点场景进行定向优化。比如“路口突然出现的行人鬼探头”、“拥堵路段变道时的犹豫判断”,这些难以在真实驾驶中大量采集的场景,可以在X-World中反复生成、反复训练。
数据合成与增强。 X-World可以生成缺失的长尾场景数据,补充训练集。同时,它还可以生成海外市场的驾驶场景数据——为小鹏的全球化部署做训练数据的提前准备。
VLA 6.2.0:用户手里的真实体验
技术架构的突破,最终要体现在用户的真实体验上。
2026年5月,小鹏推送VLA 6.2.0版本更新,随小鹏GX上市同步逐步推送。这不只是一个软件版本号的变化,而是620版本新增了漫游功能,打通了全场景的能力。
核心体验变化
小鹏社区用户实测反馈,集中指向三个维度的提升:
上一版本偶尔出现的急刹、猛加速,在VLA 6.2.0上几乎消失。高速上遇到大货车,系统提前平稳向左侧偏移出安全距离,没有任何突兀的方向修正;晚高峰遇到加塞车辆,温柔减速让行,跟车距离控制精准。
这些变化,来自规控模型的底层优化——模型学会了“什么是顺畅的驾驶”,而不只是“什么是安全的驾驶”。
园区漫游功能让“召唤车辆到身边”成为现实:在停车场点击“召唤”,车辆自动绕开障碍物和行人,稳稳开到面前。全场景原地起步则彻底取消了智驾激活的“门槛”,不需要设置导航,不需要在特定场景下,系统随时待命。
突然出现的电动车或行人,系统的制动决策几乎是瞬间完成,刹车力度线性,不会有“猛往前拽”的感觉。变道决策也果断了许多,只要旁边车道有安全空隙,系统立即执行,不会犹豫等待。
这三个维度,流畅性、便利性、响应速度——恰好对应了用户对智驾最核心的三个需求:开着不累、用着方便、关键时刻靠得住。
里程碑数据:50%的驾驶里程交给AI
技术体验之外,2026年5月小鹏发布的VLA推送首月出行报告,提供了一个更有说服力的指标:智驾里程占比首次突破50%。
这意味着:小鹏车主超过一半的驾驶里程,是AI在替他开。不是“偶尔体验一下”,是“已经习惯交给AI”。
这些数字指向一个结论:智驾从小鹏的“技术标签”变成了用户的“使用习惯”。这不是营销的胜利,是技术成熟度的胜利。
写在最后回到文章开头的问题:为什么小鹏说“AI将重塑一切行业,包括汽车”?
规则驱动时代,汽车是一个执行机构——人发出指令,车执行动作。
数据驱动时代,汽车是一个学习系统——人教会它原则,它自己在复杂场景中做出判断。
而小鹏正在做的,是让汽车学会“思考”。
#小鹏GX价格炸裂# #小鹏第二代VLA一套模型打通全场景#
