网友at我,说 “梁文峰表示 英伟达护城河正瓦解,XX超节点可完全平替”。。
我大概看了下,大概意思就是我们4张卡顶勋子1张卡。4:1 ,我们卡便宜,电便宜,上人海战术不怕。。其实不是这样的,我们都知道,有一个概念叫 集群的平均无故障时间(MTBF),这里面有个公式 MTBF(集群) = MTBF(单节点)/N
如果一张卡无故障时间是1万小时,也就是两次故障(比如掉卡)的间隔是1万小时。
那么一张万卡集群的无故障时间是= 1万小时 / 1万 = 1小时,也就是每个小时都要集群出问题,从断点(checkpoint)重新启动开始训练。
那如果是1万张勋子这边的卡,1小时还是可以接受的。换成XX的卡,4万张卡,那么MTBF就是15分钟,走15分钟停一把,走15分钟停一把,这个损耗就大了去了。
上面是简单的算法,当然了,实际最优检查点间隔,更准确的算法是 sqrt(2 × 检查点开销 × MTBF)。也就是说,损耗是按平方根走的,不是线性走的。故障率翻四倍,浪费比例大概翻两倍。
此外,四倍的卡意味着四倍的光模块、四倍的互联链路、四倍的电源和液冷回路,4倍的机柜占用面积,损耗真得很大。
所以我们不能盲目认为4个打人家1个,松松的,不是这样的,故障率提高,效率就低了,人家训得快,我们慢,这是巨大的劣势,要冷静。。
另一方面,HBM如果过程替代也有很长路要走,据说我们国产芯片良率不够,还得长期依赖洋内存。我们良率不够,万众一心,大炼钢铁,也不能不顾及损耗和产能。
另外现在训练上的新的强度,有些行业内的秘密,我还不能说,未来训练压力只会更大,你看KIMI参数都搞到2.8万亿了,以后还会继续scale的。。
发布于 江苏
