硅谷陈源博士
25-06-27 21:10 微博认证:美国佐治亚理工学院计算机科学博士,NVIDIA(英伟达)主任工程师

再写篇关于英伟达GB200 NVL72系统的小作文。随着AI模型越来越大和复杂,对GPU系统的规模和性能也提出了前所未有的挑战。极致的性能需求,使得GPU系统不同于传统互联网应用集群使用水平扩展(scale out),而是优先采用垂直扩展(scale up)。

英伟达的GB200 NVL72 就是一个典型例子。一个NVL72 系统集成了18个计算节点和9个NVLink交换机,共包含36个ARM CPU和72块GPU。所有GPU通过NVLink交换机高速互联,可以直接访问彼此的内存。

通过 NVLink的高速互连,每个GPU能获得比传统互联方式高出几个数量级的带宽。从用户角度来看,GB200像是一台超级计算机,或者说是一块巨型的“超级GPU”。

当然,这种系统架构在软件层面也带来了不少挑战。我目前参与的一个项目,就是解决如何在Kubernetes中原生支持GB200。

不过,对于超大规模模型来说,一个NVL72机柜的资源仍然无法满足需求,最终还是需要走向水平扩展。

NVL72使用的铜质跨接电缆传输距离有限,尚无法实现跨机柜的互联。硅光子技术有潜力解决这一问题,但在大规模系统中的集成仍面临挑战。因此,短期内我们仍需依赖传统的以太网或InfiniBand网卡来连接多个机柜系统。

最近,AMD高调宣布了他们的Helios系统,虽然尚未披露太多技术细节,但从已知信息来看,其结构和英伟达的NVL72很类似,尽管它的网络互联方案是基于正在发展中的UALink(Ultra Accelerator Link)标准。UALink是业界为对抗NVIDIA NVLink而提出的互连方案。

无论采用哪种技术路线,支撑大规模AI模型训练和推理的GPU系统,对网络互联的规模和性能要求都在迅速攀升。作为提供网络芯片和技术的关键厂商,博通无疑将是这一趋势中的最大受益者之一。

#GPU##英伟达##GB200##人工智能#

发布于 美国