NVIDIA AI Factory 五大网络支柱
1、Scale-Up
同一个机柜里面,几十块 GPU 紧紧抱团,当成一块超级大芯片用。
Rubin 的 NVL72 就是这个,GPU 之间高速互传数据,大模型拆分运算、低延迟,单机柜内部核心互联。
2、Scale-Out
把很多个GPU 机柜互相连起来,拼成一个超大算力池。
一个机房里几百 / 上万块 GPU 协同干活,就是这套,对应 Spectrum-X 交换机、NPO 光引擎,我们之前重点跟踪的光模块、正交背板主要服务它。
3、Scale-Across
不同城市、不同数据中心的算力大集群远程打通。
比如珠海机房和上海机房的算力协同调度,长距离高速互联。
4、Context Memory(CMX,上下文共享缓存)
给大模型开一个公共 “共享记忆库”。
很多用户同时提问时,模型不用反复重新加载历史对话内容,直接读取公共缓存,大幅提升推理速度,专门适配 Agent 智能体高并发场景。
5、Scale-In
算力集群的 “大门+门卫+物流通道”。
外面用户、智能体、知识库、存储数据,要进出算力集群,全部走这套。
用 DPU 单独扛下权限校验、加密、数据搬运工作,不占用 GPU 主机资源,不让算力被杂活拖累。
发布于 广东
