在近期由三位研究员发起的 DrivingBench 封闭场地测试中,只有 GPT-6 Astra 成功驾驶一辆丰田卡罗拉跑完 134.7 米赛道,而 Claude Fable 5.1、Grok 4.6 等主流大模型均未能完成全程,这直接回答了大语言模型能否直接开车的问题:现阶段通用大模型尚不具备可靠的真实道路驾驶能力。
一、各模型在实车测试中的具体表现
测试背景:DrivingBench 项目用一台丰田卡罗拉搭载 Comma 4 设备,通过 MCP 服务器建立"模型指令→网关→openpilot"的控制闭环,在湾区停车场铺设 134.7 米含弯道与直道的赛道,每个模型最多尝试 3 次。
GPT-6 Astra:唯一成功完成全程的模型,第 2 次尝试即 100% 通过,耗时 5 分 22 秒,共发出 24 条命令。
Claude Fable 5.1:3 次尝试的进度分别为 9%、10% 和 45%,最好成绩完成赛道 45%。
Grok 4.6:3 次尝试进度为 8%、11% 和 10%,基本在第一个弯道处就已失败。
其他模型:GPT-5.6 等模型同样未能通过首个弯道,全部止步于赛程前段。
二、通用大模型难以直接驾驶的原因
云端推理延迟:每次驾驶决策都需要经过云端大模型推理,产生数秒级延迟,无法满足真实驾驶所需的毫秒级响应。
成本极其高昂:Astra 完成 134.7 米赛道消耗约 660 万 tokens,花费 7.74 美元,折合每公里成本近 40 元人民币。
速度过于缓慢:全程平均时速仅 1.5 公里,"比走路快一点",这种表现距离可用驾驶差距巨大。
架构本质错位:聊天模型天生为生成文本而设计,其概率采样机制和通用推理路径并不适合实时控制任务。
三、行业量产路线的实际方向
专用 VLA 模型成主流:业界共识是放弃通用聊天模型直接开车,转向 VLA(视觉-语言-行动)模型,将感知、规划、决策集成在一个模型中,实现车端本地推理,摆脱云端延迟与网络依赖。
国内已有量产案例:商汤与东风合作的生成式智驾已量产,元戎启行与高通打造的 VLA 模型也已上车,均采用车端推理方案。
通用大模型仍有益处:封闭场地测试证明大语言模型已具备理解驾驶任务的能力,其在多模态感知、常识推理方面的积累,可为 VLA 模型研发提供借鉴,最终实现"从封闭场地能开,到真实道路安全开"的进阶。