小鹏的基座模型团队近日公开TuringViT视觉编码器技术成果,这是小鹏在物理AI底层架构上的最新突破。该技术仅用10%的训练数据,即可达到行业主流模型同等甚至更好的识别效果,高清画面处理速度更快。
TuringViT面向自动驾驶、人形机器人等物理AI场景,针对性解决了高分辨率感知算力消耗大、训练数据成本高、画面尺寸适配难三大瓶颈。我再来通俗的解读一下:
一、Turing 线性注意力
以前的AI模型在处理高清图片或视频时,需要分析画面中的每一个像素点及其相互关系,计算量会随着画面清晰度的提升而成倍暴增。TuringViT 发明了一种更聪明的观察方法,叫做“Turing 线性注意力”。它不再傻傻地分析所有细节,而是学会了抓重点:先用一种高效的方式快速理解画面的大致内容和结构,而且同时能聚焦关键的细节:在有必要时,对少数关键区域进行精细分析。
这就像一个侦探走进一个凌乱的房间,他不会像保洁阿姨一样从地板开始一寸一寸地检查,而是先快速扫视全场,锁定可能有线索的书桌、床底等几个关键位置,然后再集中精力去搜查这些地方。既能迅速掌握房间的整体情况,又不会遗漏重要线索,大大提升了效率。
二、VISTA-Curation数据治理:
传统AI模型想要变聪明,通常需要“喂”给它海量的图片和文字数据进行学习,就像让学生通过“题海战术”来提高成绩。但这不仅成本高昂,而且网络上的数据鱼龙混杂,很多是无效甚至错误的信息,学习效率很低。
小鹏没有选择“题海战术”,而是为AI请了一位特级教师,也就是VISTA-Curation,这位导师会严格筛选学习资料——
过滤垃圾:扔掉模糊、低质量的图片。
精准注解:为留下的每个素材配上精确的描述。
复审确认:确保图片和文字描述高度匹配,没有歧义。
传统的学生刷了10000道良莠不齐的练习题;而叫小鹏的学生只做1000道由特级教师精挑细选、带有详细解析的经典例题。最终,不仅花的时间和精力少得多,考试成绩反而更好。
这就是该技术仅用10%的训练数据,即可达到行业主流模型同等甚至更好的识别效果,高清画面处理速度更快的秘诀。
三、原生动态分辨率训练,天生灵活。
很多AI模型在学习时,看的都是统一尺寸的图片。但现实世界是多样的,汽车摄像头、机器人摄像头拍到的画面各种各样——有的是正方形,有的是长方形,有的是圆形的超广角鱼眼镜头。
而TuringViT 从预训练开始,就让它接触各种不同尺寸、不同长宽比的图片和视频。它学习的不是如何看懂某一种画面,而是如何看懂任何画面。
这就像培养一个运动员,传统方法是让他在比赛的标准尺寸的场地上训练,一旦比赛场地大小有变,他就会不适应。
而TuringViT的训练方式,是让他在各种大小、形状的场地上都进行练习,所以无论未来遇到什么样的场地,他都能立刻适应,发挥出最佳水平。
对于AI来说,也无需再进行额外的适应性训练,大大降低了开发和部署成本。
四、相关科普阅读:
1.VLA2.0与传统VLA:http://t.cn/AXVhDkR7
2.Visual CoT与世界模型:http://t.cn/AXfhAjh9
3.X-World世界模型:http://t.cn/AXICd0FI
#小鹏新模型10%数据训出顶级效果##大v聊车##小鹏汽车[超话]#
