聊聊特斯拉FSD模型的一点非共识。
个人观点,供参考。
1、特斯拉并非One Model,而是近200个小场景模型的组合。
根据海外绿神对于固件的反向分析可以看到,
1)HW4有110和189两套模型组合,其中
——节点 A 包含 189 个神经网络,而节点 B 包含 110 个神经网络,61 个神经网络为节点 A 与节点 B 所共享。
2)不同场景、不同速度分配了不同模型
——针对工厂、高速公路、城市街道及目的地(接近阶段)等场景,系统部署了独立的端到端模块。
——这些模块(除工厂场景默认全为低速运行外)均包含“常规”和“低速”两种运行形式。
3)模型采用组合方式运行
——系统架构采用分块化设计,各部分根据运行需求表现为独立运行或流水线式协作两种状态。以 FSD_E2E_FACTORY_PART_X 为例,该模块在逻辑上属于一个单一网络,但在实际部署中被拆分为多个子网络进行处理。关于这些子网络具体的组合逻辑与重组机制,目前尚未进行深入的细化分析。
4)HW3和HW4大部分模型相同,HW4新增的模型尺寸远大于HW3
——HW3 与 HW4 平台之间共享的神经网络数量总计达到 135 个。
——HW3 平台在当前的 v12.6 版本中,其节点 A 大小为 1.2G,节点 B 大小为 3.1G;HW4在v13版本中,节点 A 大小为 2.3G,节点B 的大小增至 7.5G。
2、目前的大模型领域也有类似思路
1)大模型领域正在引入Agent模式。
比如行业内不少人认为GPT4o开始不是一个大模型,而是由入口处的模型来判断输入的内容,然后路由给相关的模型,然后给出答案。
马斯克的Grok 4也是类似的思路,Grok 4为标准版本,支持单代理推理;Grok 4 Heavy为多代理版本。
2)不过对于FSD来说,还没到Agent这么智能
这块我赞同@猩红线歌者 在这条微博下的评论,http://t.cn/AXGTuMKv
3、从特斯拉的36赫兹也可以看出来,肯定是小模型。
如果说在HW4上用448GB/s的带宽,还能解释为什么它这么快。
但是在HW3上,特斯拉的带宽只有68GB/s(128bit LPDDR4 4266)。
而HW3的模型的总尺寸,也就是HW4的一半,这个带宽跑一大的个One Model肯定是跑不了这么快的。
>在现有条件下,一味把模型参数量增大,会带来时延问题。
图像信息进去变成Token,Token再输入到芯片中,芯片再通过prefill和decode的阶段,最后输出Action Token。图像信息加上下文信息,一次就会输入1000多个Token, 导致prefill阶段的延迟。想要对环境信息描述越准确,就需要输入越多的Token。输出信息想要足够精确,就要尽可能更多的输出Action Token。 而Action Token输出的越多,延迟也会越大。
但这又不是早年Waymo在后备箱直接装两块A100的年代,现阶段绝大多数智驾芯片的散热功耗通常被限制在100瓦左右。
4、反过来说,特斯拉是个把工程化做得很细致,伪装成自己是高科技的公司。
说实话,特斯拉的这一套思路,我个人觉得更像华为这种搞工程化的公司能搞出来的事。
当然话说回来啊,马斯克其实也是一个工程师,不是科学家,很多人把马斯克误解成了一个科学家。但马斯克的厉害之处是他相对能用落后或者成熟一点,更便宜的技术,搞出来更好的东西。
所以FSD这一套东西非常工程化,也很能够理解。
PS:特斯拉的丝滑,并非完全来自于它的算力和模型,有很大一部分是来自于特斯拉重写了车控操作系统,让从控制到执行的延时低了很多。
此处手动艾特大疆和华为车bu,我线下都跟他们开发人员闲聊过,都提到了燃油车的延时难搞。
PS2:国内号称HSD的地平线极大概率也不是One Model,主要问题还是特斯拉的影响太大了,他们跟着营销这个概念而已。
#微博新知#
发布于 北京
