让前沿大模型直接接管真车驾驶的基准测试 DrivingBench 上线了。研究团队将一辆丰田卡罗拉的方向盘、油门与制动权限直接开放给模型,在封闭锥桶赛道上实测其控车能力。测试允许模型在同一长对话上下文中最多尝试三次,以便其结合上一次的运行反馈调整策略,并全程公开轨迹回放、控制指令与 Token 开销。首批实测中,GPT-6 Astra 在第二次尝试中以 5 分 22 秒跑完全程,成为目前唯一达成 100% 进度的模型,而 Claude Fable 5.1 与 Grok 4.6 的最好成绩仅分别为 45% 和 11%,实车表现分化十分直观。项目主页见 drivingbench.com
发布于 北京
