华为想让100万个处理器,像一台计算机一样干活。
9月17日,上海,Peerium计算架构发布。嵌套并行、统一内存寻址、平等互联——三项技术把百万级处理器捏成一个整体。关键互联叫灵衢,官方说法是能无限扩展CPU、NPU、内存和SSD。
硬件已经在跑了:Atlas 950超节点,25.6万卡,进入部署阶段;基于NPO的Atlas 960系统正在测试。灵衢昇腾950智算集群云服务,9月30日国内商用,11月30日全球商用。
这件事的关键词不是"百万",是"一台计算机"。
过去堆集群,卡越多协同损耗越大——数据在节点之间来回搬,算力在空转。统一内存寻址要砍掉的,就是这笔搬运成本。
但真正的门槛在软件。硬件可以堆,编译器、框架、算子库得重新适配一遍。这部分的时间成本,比硬件难压缩得多。
对做AI的公司来说,这直接决定训练成本能不能降下来,而成本最终会传导到模型定价上。
芯片是微观韬略,服务器是宏观韬略,原理一样,只是适配时间问题。华为算力的综合能力,指数级增长可能才刚开始。这套技术再叠上光芯片光通讯,三年见分晓——也就是2030年。
你觉得百万卡协同,最难的是硬件还是软件?评论区聊。
发布于 广东
