大语言模型能不能直接开车?答案是能,但还停留在实验室验证阶段——目前最受关注的是一台丰田卡罗拉直接在封闭场地内让AI掌控方向盘的真实测试。

  一、真实车辆直接控制的探索

  实车基准测试已上线:DrivingBench项目将一辆丰田卡罗拉的方向盘、油门与制动权限直接开放给大模型,搭配comma.ai硬件在封闭锥桶赛道实测控车能力。

  模型表现差异显著:GPT-6 Astra在第二次尝试中以5分22秒跑完134.7米全程,成为唯一完成100%进度的模型;Claude Fable 5.1最好成绩为45%,Grok 4.6最好成绩仅11%。

  测试机制特殊:模型可在同一长对话上下文中尝试三次,结合上一次运行反馈调整策略,全程公开轨迹回放、控制指令与Token开销。

  二、融入自动驾驶体系的VLA大模型路线

  VLA定义:VLA(Vision-Language-Action Model)将视觉、语言与行动能力融合在一个模型中,让自动驾驶像人一样感知、思考与适应环境。

  行业应用方向:理想汽车等发布的VLA司机大模型,通过预训练构建交通常识、强化学习训练博弈能力、RLHF实现驾驶价值观对齐,用户可用自然语言向车辆下达指令。

  语义理解优势:传统几何模型难以理解“孩子正要向马路扔模型飞机”这种语义场景,只有具备人类水平语义理解能力的智能体才能处理无穷无尽的边缘案例。

  三、为什么还不能完全放手

  延迟与实时性瓶颈:专业驾驶模型以20Hz频率更新目标曲率与加速度,而云端大模型面临图像上传的往返时间,像每隔几秒才看一眼手机的司机,无法应对突发路况。

  成本与效率问题:Astra行驶135米耗时超5分钟,速度仅0.42米/秒,消耗了价值7.74美元的Token,而人类驾驶同样路径只需15秒。

  安全与伦理挑战:测试中Astra曾因察觉自己在驾驶真车而拒绝执行指令,直到开发者将工具名称改为“DrivingBench Sandbox”才放下戒备——模型的安全判断高度依赖语境。