聊聊智驾的底层逻辑
得益于我有一个智驾工程师老铁,特别是这位老铁在语言表达方面非常有天赋,让我在智驾这块有了非常深刻的理解。现在我要做的事情就是把这个看上去很高大上的东西,用最简单的语言描述出来。
首先说智驾路线。智驾路线实际上现在只有一条,就是端到端。无论是什么VLA,大世界模型,还是纯视觉或者激光雷达方案,本质上来说,底层核心都是端到端。那么技术路线一样,实际上也就不存在什么代差了,无非就是细节打磨的程度不同,或者功能取舍不一样。
那么什么是端到端呢?那就要先说怎么建模了。大家应该都玩过乐高吧,实际上建模就是通过传感器把探测到的物体转换成一个个标准尺寸的方块,从后台看实际上就是乐高的样子。传感器的分辨率决定了这个乐高像素的大小,是10厘米边长的立方体还是20厘米边长的立方体。传感器分辨率越高,算力越高,建模越细。
说完建模再来说端到端。端到端其实就是建模完成以后,在所有的建模中间画一条可以行驶的轨迹线,然后车辆顺着这条轨迹线行驶,这就是端到端。
是不是很简单?
端到端最大的优点是,它不用去分辨你面前的是什么东西,它只建模,然后告诉你,这里有个2米高2米宽的东西不能撞。这个做法极大的节省了系统资源,以至于老旧的单orin还能正常运行。国外有一个特斯拉躲避对向车道撞过来的卡车的视频,实际上在系统里显示的是,有一个3米宽4米高的东西撞过来,计算出预测路径,躲开它,就这么简单。
在没有最新的架构之前,端到端就是目前暂时唯一可用的架构,所有的厂商只是在上门缝缝补补。有可能你会看到某个宣传视频特别牛,别多想,那个多半是“把所有的规则都删掉,出一个媒体版。什么AEB,AES咱们通通关掉”。有可能你看到某个技术交流会说的特别难懂,别慌,那个估计就是“找一些媒体,开一个workshop,说一堆云里雾里的词,什么第一,什么模型,什么100B大模型上车,30hz无损出轨迹,热力学模型。 硅谷说什么你说什么”。
负责人总不能说我们这个架构一直用到现在,三年了。他总得找点借口让老板继续投钱。
我估计,他们可能有更新的路线。但是,特斯拉不动,他们就不敢动。端到端那会其实也是这样。
马圣还是nb。 http://t.cn/AXSL2Xrd
发布于 上海
