音容宛在的肥佬
26-10-02 17:32

#DeepSeek开源华为昇腾组件#

梁文锋和Deepseek(含幻方量化)团队这次是为全世界AI研发人员提供一整套开源的Tilelang组件,这套组件的底层硬件支持英伟达Hopper系列和Blackwell系列GPU,也支持华为昇腾系列950NPU。

这件事意义非常重大,可以说改变了整个AI加速计算生态的发展趋势,大概率比当年JAVA问世实现跨平台开发框架还要厉害。

Deepseek从技术上证明了两件事,第一件事是AI加速计算可以实现软件与硬件解耦,一套软件可以跨硬件平台训练、推理;第二件事是跨硬件平台的高级编程框架这件事,中国人目前是世界最强,以后很可能也是。

英伟达GPU和华为昇腾NPU的AI加速计算范式有很大区别,2025年Deepseek已经为英伟达发布了开源的Tilelang基础组件,这次的昇腾版是与英伟达版“一一对应”。大家注意“一一对应”这个词,这就是跨平台AI统一编程框架的雏形。

Deepseek的TileLang基础组件,不仅仅是开源,最重要的是以实测数据对开发者承诺“逼近硬件性能极限”,换句话说你用Tilelang写得AI软件英伟达上跑出硬件极限性能,在昇腾上也能跑出硬件极限性能,至于底层如何调度并发如何搬运数据如何分配矩阵计算负荷,你不用管,Deepseek开源组件帮你搞定。按照坊间传闻,四块950打平一块B300,横向扩展比钱多电多光互连模块多,按这个配硬件保证性能一致,多配确保性能跨越,爽不爽[哈哈][哈哈][哈哈]

AI加速硬件三大流派,英伟达GPU、谷歌TPU、华为昇腾NPU,中国国产算力还有寒武纪MLU、海光DCU,原理架构近似GPU,谷歌TPU自产自销垂直封闭,市场上主流产品就是GPU和NPU,Deepseek挟Tilelang框架开启开源组件一统天下大潮,实在是太过威武,鹅且没有竞争者。因为西方开发者不太可能为昇腾、寒武纪、海光写基础组件………

Deepseek的基础组件水平非常高,特别在MOE实现上比英伟达原生工具更能释放英伟达GPU性能潜力,这件事整得英伟达爱恨交加,毫不犹豫主动投怀送抱。这个形势下,开源会变成一个非常非常非常独特的优势,高水平研发人员可以通过研读基础组件代码深入理解英伟达GPU和昇腾NPU的硬件架构和………“正确使用方法”,促进全世界算力芯片设计水平和应用能力的提升;另一方面,国产算力芯片也可以更加容易地加入到Tilelang生态中,加快构建中国主导的AI加速计算跨平台编程框架,造福全世界。

前途是光明的,道路是曲折的,话说回来,这个跨平台框架目前支持的硬件还比较少,功能集也远没有实现全覆盖,但是星辰大海的第一步已经迈出,世界格局已经改变[努力][努力][努力]

月之暗面杨植麟曾经说过AI研发的关键在于组织创新,显然Deepseek就是一个例证。

Deepseek自己的AI- Infra团队能够写出比英伟达和华为昇腾官方更高效的编程组件,这就是组织创新的结果,硬件公司估计是跟不上了,CUDA要小心了。

最后说个希望,憋出这么个大招极其消耗资源,既然成果已经发布,接下来希望Deepseek继续加油,在基座大模型上好好发力,早日重回巅峰[鲜花][鲜花][鲜花]

发布于 浙江