Livis智能系统中的VLA(视觉-语言-行动)司机大模型,其训练过程如同人类考取驾照,需经历“学会看路—驾校实操—上路强化”三阶段,分别对应基座预训练、模仿学习后训练与强化学习,最终让AI像老司机一样既会开车又会沟通。
一、预训练阶段:教模型“看懂世界”
视觉基座(VL):引入3D物理世界视觉数据与高分辨率2D数据,将图像分辨率提升10倍,让模型清晰识别车道线、路牌、行人等元素。
语言语料:加入交通与驾驶相关的大量文本,增强对“限速60”“无保护左转需避让”等规则的理解。
联合语料:将导航地图与车辆语义理解结合训练,使模型学会把“看到的路况”与“语义规则”对应起来,建立对现实场景的综合认知。
二、后训练阶段:像去驾校一样“学开车”
模仿学习:此阶段本质是模仿人类驾驶行为,模型参数量从约32B扩展至接近40B,在端到端架构中学习变道、转弯、掉头、泊车等基础驾驶技能。
动作模块接入:新增动作生成模块,将视觉与语言特征转化为具体控制指令(加速、减速、转向),实现从“看懂”到“能开”的关键跃迁。
三、强化学习阶段:上路实战并“开得比人好”
RLHF(人类反馈强化学习):利用海量人类驾驶数据,让模型生成的驾驶轨迹更贴近真实驾驶员的习惯与舒适度。
纯强化学习(RL):将模型放入“世界模型”仿真环境进行数以千万计的虚拟训练,通过碰撞反馈、交通规则反馈和舒适性指标(G值)持续优化,开得比人类更安全稳健。
持续进化:借助世界模型仿真,验证成本从每万公里17-18万元降至4000元,实现天级模型迭代,让AI司机在真实道路上越用越聪明。
四、数据飞轮与算力底座:训练背后的“隐形引擎”
数据闭环:依托百万车队与十亿级数据资产,单次训练数据吞吐量比半年前增长10倍,通过主动式数据挖掘持续补充长尾场景(如礼让乡路羊群、雾天识别手势)。
算力与架构创新:端侧模型参数量达主流VLA的15倍以上,通过混合专家架构(MoE)与稀疏注意力机制提升计算效率,在有限车端算力下实现更快的决策响应。