前沿在线
26-07-22 18:53 微博认证:前沿在线微博官方账号

英伟达Rubin GPU架构公布:
为智能体时代量身定做的算力 英伟达今天正式公开了Rubin GPU的完整架构细节,几个核心数字先划重点:
台积电3nm工艺、3360亿晶体管、智能体AI性能能效比Blackwell提升10倍。 这不是常规的参数升级,英伟达这次的优化方向非常明确——冲着Agent智能体 workload 去的。

架构上,Rubin用两块光罩极限尺寸的Die通过NV-HBI高带宽接口封装在一起,晶体管总数比Blackwell GB300多了62%。内部8个GPC、224个SM、896个Tensor Core,规模上是实打实的下一代旗舰。 但真正的看点在三个针对性优化: **增强型Tensor Core支持扩展精度**,配合第三代Transformer引擎,FP4算力达到50 PFLOPS。智能体推理不需要全精度,但对吞吐量和能效要求极高,这一刀砍得很准。

HBM4内存系统全面升级,8堆12-Hi堆栈总共288GB容量,峰值带宽22TB/s,比Blackwell的8TB/s直接翻了1.8倍。大上下文、高并发、逐令牌生成阶段的权重和KV缓存移动,都是吃带宽的大户。

互联带宽全面拉满,NVLink 6提供3600GB/s的GPU间互联,NVLink-C2C是1800GB/s的CPU-GPU通信,PCIe Gen6也安排上了。智能体时代不是单卡跑推理,而是大量GPU协同工作,互联瓶颈比单卡性能更要命。

做科技媒体观察下来,Rubin释放的信号很清晰:
英伟达已经不满足于做更快的训练芯片,开始为Agent时代重新设计整个算力底座。10倍的智能体能效提升,意味着单位Token成本会大幅下降,这才是真正能推动智能体规模化落地的底层变量。 Blackwell刚铺开没多久,下一代的牌就已经亮出来了。AI算力的迭代速度,比模型本身还快。#前沿在线# #AI# #英伟达# #人工智能#

发布于 北京