【英伟达悄然重启Rubin CPX:专攻AI推理预填充,2027年Q1量产】
知名分析师郭明錤最新产业调查显示,英伟达已重新启动AI推理预填充加速GPU项目「Rubin CPX」,产品设计大幅调整,预计2027年Q1开始生产。
📌 为何重要:超50%的AI推理工作负载来自输入上下文处理及KV Cache构建,预填充效率直接决定推理成本与部署经济性。
🔧 核心规格(对比原方案):
• 显存:128GB GDDR7 → 168GB HBM4(仍低于标准Rubin的288GB)
• 功耗:单卡最高2300W,算力接近标准Rubin GPU
• 8卡托盘合计约1.34TB HBM4,覆盖多数长上下文KV Cache需求
🗄️ 机架:由共享改为独立MGX ETL,支持64/128/192/256卡按需扩展,每64张为一模块(8计算托盘+1交换机托盘)。
⚙️ 分层互联(性能vs成本取舍):
托盘内:8卡NVLink Scale-up(1–1.5TB/s,低于标准Rubin 3.6TB/s)
模块内:Spectrum-6以太网全铜L1链路
跨模块:OSFP光纤链路
🤝 部署:CPX与Rubin GPU按1:1协同——CPX预填充→生成KV Cache→以太网RDMA→Rubin解码。
定位:「长上下文预填充的最佳性价比方案」,非取代标准Rubin,而是把推理流程拆分,用专用硬件压低长上下文推理成本。
#英伟达# #NVIDIA# #RubinCPX# #AI推理# #GPU# #郭明錤# #人工智能# #算力# #HBM#
发布于 江苏
