#DeepSeek开源昇腾基础组件#查了一下,这个开源给未来带来的影响挺大的:
1. 大幅降低昇腾大模型开发门槛,打通CUDA到昇腾的迁移通道
这套组件和英伟达平台版本一一对应,部分接口保持一致。开发者同一套上层代码,可在英伟达GPU与昇腾NPU之间迁移,不用从零重写底层算子。TileLang语法更简洁,开发者不用深入啃底层硬件指令,就能写出接近硬件性能上限的算子,降低国产算力的开发成本。DeepSeek V4模型训练所用算子,现在在昇腾上都有高性能实现,还联合优化了昇腾950的128卡大规模集群方案,支撑大模型分布式训练。
2. 补齐昇腾软件生态短板,缓解国产算力“芯片强、软件弱”痛点
长期以来国产NPU最大瓶颈不在硬件,而是算子库、编译器、分布式通信等底层软件栈。DeepSeek把大模型实战打磨后的全套基础设施开源,直接提供矩阵计算、注意力、多卡通信等训练刚需组件,不是简单demo,而是真实跑过超大模型的工程代码,能带动更多中小企业、科研机构在昇腾上做模型训练与微调,加速昇腾生态扩张。
3. 构建跨芯片通用软件范式,不止服务昇腾
TileLang是独立于CUDA的高级编程体系。这次落地昇腾,未来其他国产AI芯片只要适配TileLang,就能复用整套算子库,形成模型厂商定义软件标准,芯片厂商适配硬件的新模式,摆脱对CUDA生态的单一依赖,推动国内AI算力底层软件自主可控。
4. 产业层面:利好国产算力集群落地,增强供应链韧性
国内AI大模型企业,可以基于昇腾+TileLang搭建自主可控的训练集群,减少海外算力约束。开源模式让整个行业共享算子成果,避免各家重复造轮子,加速国产大模型训练、推理落地。
5. 局限
TileLang属于新增软件栈,开发者需要学习新语言;昇腾硬件底层特性、CANN体系仍有差异,极端场景下依然需要针对性调优,短期内还无法完全替代成熟CUDA生态。 http://t.cn/AXWYElXz
发布于 浙江
