蚁工厂
26-09-02 08:16 微博认证:科技博主

系列技术博文:DeepSeek-V3:从理论极限到现实实践 -- DeepSeek-V3系列性能分析实战 --这个系列又更新了一篇~
整个系列的介绍见:http://t.cn/AX0GIvfJ 该系列作者是Edward Z. Yang,在 Meta 公司从事 PyTorch 相关工作。
文章都搭配有非常精美的可视化交互图表。

更新的这篇是《显存:以 Hopper GPU 为例:如何把 DeepSeek-V3 塞进 80 GiB 显存》

GPU内存就像氧气:平时你不会意识到它的存在,直到耗尽时才明白其他一切都不重要。当模型出现OOM(内存溢出)时,若能根据并行策略、激活检查点和低精度计算的组合方案,对模型应占用的内存量有合理预期,就能判断实现是否存在bug导致内存超支。同时,了解降低内存占用的调节手段也至关重要——你经常会遇到这样的场景:主力训练的模型恰好因内存不足而无法运行,需要在不过度牺牲MFU(模型浮点运算利用率)的情况下优化内存。例如,最初版本的DeepSeek-V3预训练就在2048块H800 GPU(内存容量与H100 SXM相同)上完成——正如我们将看到的,在这种配置下内存使用非常紧张!

发布于 山东