大语言模型确实能踩下真实车辆的电门,但刚跑完一段134米长的封闭停车场赛道,就暴露出延迟高、成本贵、速度慢三大硬伤,与量产自动驾驶还有明显距离。
一、实测结果:开得动,但开不快也开不起
测试背景:DrivingBench 项目将一辆丰田卡罗拉的方向盘、油门与制动权限开放给大模型,在湾区停车场用锥桶布置出134.7米赛道,考察模型在真实物理环境下的感知、规划与控制能力
成绩分化:GPT-6 Astra 在第二次尝试中以5分22秒跑完全程,成为唯一100%进度模型;Claude Fable 5.1 最好成绩仅45%,Grok 4.6 与 GPT-5.6 Sol 基本在首个弯道就失败
成本惊人:Astra 全程消耗约660万 Token、花费7.74美元,平均时速仅0.42米/秒,比人步行还慢,而人类驾驶同一路径只需15秒
二、核心瓶颈:架构错位而非能力不足
延迟致命:云端大模型每次决策需经历图像上传与回传的往返时间,而专业驾驶模型如 openpilot 以20Hz频率更新目标曲率和加速度,毫秒级延迟让云端模型无法应对突发路况
机制差异:聊天模型本质是"根据上文预测下一个字词"的统计模型,每走一步都要完整推理一次,与驾驶所需的即时反应存在架构层面的错位
安全顾虑:测试中出现有趣一幕——Astra 最初察觉到自己在驾驶真车而拒绝执行指令,直到开发者将工具名称改为"DrivingBenchSandbox"后才恢复操作,说明模型对任务性质的判断高度依赖语境
三、行业方向:专用模型才是量产之路
技术路线:业界正转向 VLA(视觉-语言-行为)模型,将视觉、语言与行动能力融合进单一模型,类似人一样"感知-思考-适应"环境,国内商汤、元戎启行等已有量产案例
落地路径:云侧大模型负责复杂语义理解,车端专用小模型负责毫秒级控制决策,软硬协同成为主流方案
核心结论:通用大模型验证了"理解驾驶"的可能性,但实时性、成本与安全验证三道门槛决定了它短期内无法直接替代专用驾驶系统