扬韬
26-07-21 17:53 微博认证:职业投资者 孙成刚

#小鹏新模型10%数据训出顶级效果#

这种技术的突破,也只有在中国。不依赖极端算力,不依赖超大模型,而是巧妙地节约数据量,提高训练精度。

简单点说——
别人用100亿张图片进行训练,小鹏只用10亿张有效图片;
别人拼算力一帧一帧扫,小鹏用架构,一下子扫全局,然后再看局部;
别人用规范的图片,小鹏的图片奇形怪状,让机器从0开始就适应。

怎样做的结果,就是效率更高了,成本更低了,训练结果更有效了。

让人担忧的是,这些顶尖技术,动不动就发论文,会不会让人家学了去啊。

小鹏集团基座模型团队近日公开TuringViT视觉编码器技术成果,这是小鹏在物理AI底层架构上的最新突破。TuringViT面向自动驾驶、人形机器人等物理AI场景,针对性解决了高分辨率感知算力消耗大、训练数据成本高、画面尺寸适配难三大瓶颈。该技术仅用10%的训练数据,即可达到行业主流模型同等甚至更好的识别效果,高清画面处理速度更快。

这是小鹏在物理AI上的探索,也是第二代VLA 以及座舱架构更新背后的核心工作之一。小鹏通用智能中心负责人刘先明发文称,视觉tokenizer既要保证对物理世界的有效压缩,又要实时处理海量视觉信息输入。TuringViT正是在软硬结合前提下为物理AI打造的一套通用视觉tokenizer,其探索的视觉处理通用性,尤其是zero shot(零样本)能力,无需针对特定场景大量采集数据,可以从底层架构上构建起横跨自动驾驶、座舱交互、机器人的基础能力,也为打通L2到L4、从中国到全球的智能化出海提供了技术支撑。

近期,何小鹏亲赴德国验收图灵AI智驾本地化适配进度,结果远超预期,欧洲路权体系与中国差异巨大,但小鹏智驾已能深度理解当地规则。这背后离不开感知层的长期积累。TuringViT为小鹏智能辅助驾驶提供了更强的跨场景泛化能力,也成为小鹏用一套感知模型打通中国与欧洲市场的重要技术前提。它所跑通的这条门槛更低、效果可复现的视觉大模型训练路径,不仅让高性能AI视觉能力从“头部专属”走向“行业普惠”,也在高阶智能辅助驾驶出海方面为行业提供了一条值得参考的路径。

发布于 上海