舆论全部集中在xx的时候,是放料的好时候。
某种意义上说,CANN开源是个绝妙的时机,虽然华为自己也没想到。
国产算卡对于CUDA和相关算子的兼容,一直有个很大的问题。
如果完全兼容CUDA,意味着bug也是feature,不然算子跑不起来,CUDA版本变化,也得跟着兼容性变化,版本始终落后NV。
如果走自己的道路,搞生态就肥肠痛苦。别人玩CUDA都是从游戏本开始的,成本为0。玩国产卡的成本至少得云上租一个,虽然也偶尔能白嫖,但比游戏本来说,白嫖的时间和机遇都难很多。
昇腾之前搞生态搞的肥肠痛苦。
算子计算的本质是,在给定硬件上,用最少的时间和空间,完成数学表达式所规定的全部计算并保持数值正确。
优化就是 把算子切成硬件正好“一口吃掉”的形状,让流水线、寄存器、缓存、Tensor Core 全速运转。
所以,要高效利用,相当于得用底层硬件相关的编程语言,编写底层运算代码。
要追求极致性能,就要手K算子。
为了卖智驾,搞了很多工程师,手K算子K了快一年,才适配了大概90%的主流算子。
CANN开源后,很快碰到了AI技能的拐点,能读文档自己K算子。
开源开出来的文档、log,能让AI Agent更好的K算子。
对CUDA的依赖度大幅下降。
生态建设能力大幅提升。
在AI的加持下,昇腾虽然还是相对难用,但已经比以前好用很多很多很多了。
包括相对难用的910B/C,现在也相对好用了。
其他家的文档和用例都不如华为全。
比如寒武纪,巨量的know-how其实是在字节手上。
再比如阿里PPU,巨量的know-how也是在阿里自己手上。
第三方想用,用好,难度就比华为大。
从算力行情上也能看出来,同样都是8卡机,910B的租赁价格快赶上A100 40G了,910C的租赁价格也在A100 80G和H100 80G中间。
虽然其中有一定的信创需求,但作为市场价,这个价格还是能反应真实供求关系的。
其他国产卡的价格都是面议了。
