Transformer-周
25-03-19 09:15 微博认证:AI博主

看了一下GTC

我觉得拿nvl576和nvl72比,似乎不太合适,所以我这还是比单卡为主,说一些有价值的信息
1- B300 7.5pflops fp8 288G hbm3e 内存带宽8G+(海力士版本),是h200能力的将近4倍,这次是真将近4倍,b300nv玩dsR1推出来每秒30000个tokens的记录(拿deepseek当benchmanrk了[doge])
2- rubin 单卡算力提升就有限了,8.7pflops fp8(除法) ,提升不到B300的百分之20,显存也hbm4了,显存带宽比3e又能提升百分之50+,综合性能还是有可能提升个百分之50以内的(后面的单芯片提升内存带宽倒成了快速提升能力的关键)
3- 纯先进制程和先进封装的提升已经到了瓶颈了,真上不去了,所以要做rubin ultra nvl572,通过高效超级nvlink网络来做多卡互联,来做一个超级箱子
4- 老黄新发的网络其实好玩的更多一点,nv的首个硅光子(光到光)1.6T/s的能力,另外的趋势是nv也要从AI网络在dc的领导权想要扩散到以太网里面,DC的里活它都想要弄,以需求新的增长
5- 另外我最关心的新的推理引擎 dynamo完全开源,其实可以理解为pd分离的高维度实现,不用你自己设计谁是prefill,谁是decoding了。pytorch,sglang,vllm和tensorRT都能支持,这个非常牛逼,能自动在分布式推理框架里找到定义好的gpu,拓扑感知,优化路由,能根据请求不同,动态定义kvcache的加载和卸载,而且支持不常用的kvcache卸载到cpu内存,sdd或者nfs(这不是ds的3fs套路)到时候看看具体效果,单从设计上而言,有一定想象力

发布于 日本