高飞
26-08-31 23:03 微博认证:至顶科技创始人 AI博主

郭明琪:Rubin CPX回来了。

英伟达的 Rubin CPX 是一款专为百万级 token 超长上下文推理设计的专用 GPU,此前计划用更便宜的 GDDR7 显存重点加速“预填充/上下文理解”阶段,和普通 Rubin GPU 搭配使用,适合大型代码分析、长视频生成等场景。​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​现在看也改为HBM了。

———

就在市场开始相信 Rubin CPX 已从 Nvidia 的产品路线图中剔除之际,我最新的行业调查显示,Nvidia 已重启该项目,预计将于 2027 年第一季度开始生产。与之前的设计相比,重启的 Rubin CPX 提供了更强的预填充性能,并在 GPU 规格和机架架构上进行了重大调整,这凸显了 Nvidia 对预填充解决方案的高度重视。

主要变化:

1. Rubin CPX GPU 规格
CPX 提供了接近 Rubin 的计算性能,并匹配 Rubin 的最大功耗额定值 2,300 W(每个 GPU)。CPX 升级至 168 GB 的 HBM4,而 Rubin 为 288 GB,先前 CPX 设计则为 128 GB 的 GDDR7。

2. 机架设计
新 CPX 使用独立的 MGX ETL 机架,而不是像之前设计那样与 Rubin 共享机架。根据需求,客户可选择 64、128、192 或 256 个 CPX GPU。在 CPX 机架内,每组 64 个 CPX GPU 构成一个机架模块,包括八个计算托盘(每个托盘八个 CPX GPU)和一个交换托盘。

3. 扩展与横向扩展
NVLink 仅用于每个托盘内八个 CPX GPU 之间的纵向扩展,每个 CPX 的 NVLink 带宽为 1–1.5 TB/s(相比 Rubin 的 3.6 TB/s)。机架模块内的托盘间横向扩展通过 Spectrum-6 以太网运行,使用全铜 L1 链路。跨机架模块的横向扩展则由每个模块的 Spectrum-6 交换机通过 OSFP 光纤链路处理。

4. 工作原理
CPX 必须与 Vera Rubin NVL72 配对,Nvidia 推荐 CPX 与 Rubin GPU 的 1:1 比例。CPX 负责预填充并构建 KV 缓存,随后通过以太网 RDMA 传输至 Rubin 进行解码。

5. 产品定位:长上下文预填充的最佳性价比
当今超过 50% 的 AI 推理工作负载来自于处理输入上下文并构建相应的 KV 缓存。因此,CPX 提供了一种更灵活、更低成本的预填充处理方式。每个八 CPX 托盘拥有约 1.34 TB 的 HBM4,足以满足大多数长上下文预填充工作负载及其相关 KV 缓存需求。

发布于 瑞典