电动知士大雨
26-08-08 08:59 微博认证:汽车博主

特斯拉AI负责人Ashok没讲的FSD V14细节,这支视频全有,建议先收藏、点赞。

视频:CVPR 2026 DriveX 研讨会 Keynote 7
演讲者:Phil Duan(特斯拉 AI 工程总监)
时长:约 30 分钟(20 分钟演讲 + 10 分钟现场问答)
主题:基于基础模型(Foundation Model)的大规模自动驾驶

演讲者是谁?
Phil Duan,特斯拉 AI 工程总监。领导了 Robotaxi 发布和 FSD V14 的 AI 开发,此前共同主导 FSD V12、V13,早期负责数据和感知团队,并参与构建 "全球最大的物理 AI 数据引擎"。是目前特斯拉智驾的核心人物之一。

核心观点(正文 20 分钟)

1. 特斯拉现状:纯视觉、Robotaxi 已实际运营

整车只有 8 个摄像头,算力在车内,不需要激光雷达或外部基础设施
手动驾驶特斯拉安全性约为美国平均水平 3 倍,开启 FSD 再翻一倍
Robotaxi 已实际运营:达拉斯和休斯顿已有几十辆无人驾驶出租车在跑,车内无司机、无人监督,通过App叫车即可使用
Cybercab(双座、无方向盘无踏板)即将量产,每英里成本极低,宣称低于公共交通

2. 为什么从模块化转向端到端

V12 之前是传统模块化:感知、定位、预测、规划各团队独立开发 ——被明确判定为错误路线。三个原因:

① 人类驾驶决策无法靠代码编写(边缘场景、长尾事件太多,有时要 "违规" 才能通过);
② 感知→预测→规划之间的接口定义不清,感知模型更好不等于最终结果更好;
③ 端到端单一大网络延迟高度确定(36 FPS 输入,光子进网络直接出动作)

明确立场:站在 "苦涩的教训" 一边—— 不把人类知识写进系统,只堆算力、模型和数据

3. 视频基础模型架构

本质是 "视频进、动作出"的单一函数,与 LLM 的" 语言进、语言出 " 同构
与 LLM 的本质差异:世界实时变化、决策有非零延迟、其他交通参与者充满不确定性
对抗性场景(车辆做出不可预测甚至恶意的行为)也要考虑进来并 "烘入模型"
训练时用大量代理任务(分割、几何、人体网格、人物追踪)帮助梯度流动;测试时只执行动作
数据来源不止车队:加入互联网数据(推理与泛化)和 Optimus 室内数据(理解椅子等普通物体)

4. 数据与算力规模

700 万辆车在路,每天累计约 500 年驾驶时长
单日训练集超 120 年驾驶时长、100+ PB 数据
FSD 累计里程刚突破 100 亿英里(V12 后指数增长)
算力接近 30 万 H100 等效,刻意维持小团队:"行业里每名工程师最高的 GPU 资源"

5. 核心训练难题(公开少见的技术细节)

维度灾难:输入是 36Hz×8 摄像头的巨大空间,输出只有 2 个自由度(转向 + 速度)—— 直接训练极不稳定
输入压缩:朴素地把像素 tokenize 会产生 "数十亿个 token,显然行不通",必须用极其复杂的方法把视频压缩到可管理的上下文
因果学习:从数百万像素里找出真正的因果关系(识别 "可左转" 与 "背景无关标志")极其困难,代理任务就是为此存在。

6. 现场问答

为什么不用 VLA?
轨迹是否做碰撞后处理?
3D 任务真值如何设定?
数据如何筛选?

本视频为搬运汉化,仅供学习交流,版权归所有方,如侵删。 http://t.cn/AXNwQujt

发布于 北京