10月2日晚的金融圈,被英伟达的一台新机器砸得彻底没法睡了。
云服务商CoreWeave宣布,Vera Rubin NVL72已经在它的云平台上正式投产。头一个把真实业务搬上去跑的客户,是AI软件公司Cognition。
最抢眼的数字是4.8倍:Cognition跑SWE-2推理,总Token吞吐量比上一代GB200 NVL72最高高出这么多;强化学习场景里,每块GPU的输出吞吐也到了3.8倍。这意味着同一套硬件能扛更多并发会话,多步推理也能快不少。
不过更该盯的是另一个数:在DeepSeek-R1基准上,每兆瓦能产出的Token是上一代的10倍。同样的电,能产出多得多的有效算力,这比单纯跑得快更关乎成本。
这个10倍其实不算新消息。7月21日英伟达披露进展时就拿出过CoreWeave的首轮测试结果,当时已有谷歌云、微软Azure、甲骨文云等合作伙伴部署了机架。9月中旬,CoreWeave又把多个机架连成了集群。从实验室数据到客户拿它接单,用了两个多月。
几个细节也值得记一下:一台NVL72由36颗Vera CPU和72颗Rubin GPU组成,全液冷;托盘不用接线,装一个从两小时缩到五分钟。CoreWeave还把Vera CPU单独作为一层算力提供,智能体沙箱启动比x86 CPU快3倍以上。
英伟达副总裁Ian Buck顺手提了一句:CoreWeave那批V100至今还在给客户干活。新机器上线了,老机器也还没下岗。
发布于 广东
