不知道大家有没有发现一个行业怪现象,现在AI算力卡越做越强,堆的数量越来越多,但集群规模拉到几十万卡之后,整体效率反而上不去。并不是芯片本身算不动,大量性能都耗在了各个硬件互相沟通的内耗上,这也是全球大厂都头疼的行业卡点。
以前搭建AI超算集群,本质就是一大堆独立硬件拼拼凑凑凑在一起。每张NPU自带专属内存,想要交换数据就得不停复制搬运,还得靠主节点统筹调度,规模越大,通信开销就越夸张,很多算力白白被消耗掉。
华为这次发布的Peerium架构,思路就跳出了这种拼接式集群的固有思维。借助灵衢高速互联,直接把海量NPU和内存资源做全局打通,全部统一编址,不存在主次节点之分。上万几十万颗芯片,不再是一盘散沙的组合,逻辑上融合成一台完整的超级整机。
打个通俗比方,过去是一堆各自办公的独立小办公室,文件要来回跑腿传递;现在直接拆掉隔间,变成一整个大通间,所有人直接共用全部资料,省去来回传递文件的巨大损耗。
它并不是彻底颠覆经典计算机基础理论,而是专门针对大模型时代改造大规模集群的运行逻辑。训练十万亿级大模型的时候,卡堆得再多,也不会出现性能断崖衰减。而且这套架构不是纸上概念,25.6万卡的Atlas950集群已经落地跑业务。
这意味着国产算力的竞争,不再只比拼单颗芯片跑分,底层架构设计这块,我们也拿出了自己的解决方案。#华为发布全新AI计算架构#
发布于 北京
