太平湖炒家
26-08-26 07:27 微博认证:投资内容创作者

NVIDIA 最近提出了一个新的概念:Scale-In。

简单理解,过去大家讨论 AI 网络,主要是两个方向:

Scale-Up,解决 GPU/XPU 之间的互联,比如 NVLink;
Scale-Out,解决服务器、机架之间的互联,比如 Spectrum-X Ethernet 和 InfiniBand。

Scale-In 主要解决的是 AI 集群和外部数据之间的连接。

比如用户请求、Agent、企业数据库、Storage、向量数据库等,都需要不断和 AI 集群交换数据。这类流量通常叫 North-South Traffic。

NVIDIA 这次给 Scale-In 配的核心方案是:

BlueField-4 + Spectrum-X Ethernet。

其中 BlueField-4 的网络带宽最高达到 800Gb/s,所以从物理连接来看,跨机架和较长距离的链路会对应大量 800G Ethernet 光模块。

这件事对光通信有一个很重要的意义:

以前大家算 AI 光模块需求,主要看 GPU 的 Scale-Out 网络,也就是 GPU Server 和交换机之间需要多少 800G、1.6T 光模块。

现在还要开始关注另外几块:

Scale-In、Storage、Front-end Network。

AI 推理和 Agent 越来越复杂以后,一个请求背后可能需要反复读取数据库、向量库、模型文件和存储数据,对外部网络带宽的要求会持续提升。

所以未来 AI 数据中心里,1.6T 很可能主要往 GPU Backend、Scale-Out 网络升级,同时 800G 继续大量存在于 Scale-In、Storage 和其他以太网场景。

这对 800G 光模块的生命周期是利好。

我觉得 Scale-In 最值得关注的地方,是它再次说明了一个趋势:

AI 对高速网络的需求已经开始从 GPU 互联,向整个数据中心扩散。

以后算光模块需求,不能只盯 GPU 数量,还要看每台 AI Server 对应多少高速网络端口,以及 Storage、Front-end、Scale-In 这些网络的带宽升级。

这也意味着,即使 Scale-Out 开始快速向 1.6T 升级,800G 的需求也未必会很快见顶,反而可能因为新的应用场景继续保持较长时间的高景气。

发布于 上海