系列技术博文:DeepSeek-V3:从理论极限到现实实践 -- DeepSeek-V3系列性能分析实战
地址:deepseek-v3.ezyang.com/
(该系列作者是Edward Z. Yang,在 Meta 公司从事 PyTorch 相关工作。这个系列目前刚更新了一篇,DeepSeek-V3架构的基础设施导向图)
如果你想学习如何在多GPU上高效训练大语言模型,可能已经接触过《如何扩展模型》和《超大规模训练手册》等资源,这些资料系统讲解了实现高模型利用率(MFU)所需的基础概念。然而,从教科书学习是一回事,在实际生产环境中针对一个月后就要训练的模型进行具体分析又是另一回事。
本系列文章旨在深入剖析DeepSeek-V3——这个在历史上具有重要影响力的混合专家(MoE)Transformer模型。在我看来,DeepSeek-V3经得起时间考验,堪称"柏拉图式MoE模型"的典范。它几乎不包含时代局限性(屈指可数),例如:三个初始密集层、全局注意力机制的全面应用、内置的多Token预测(MTP)模块,或许还有归一化层的位置选择。我坚信,深入研究DeepSeek-V3定会让你受益匪浅。此外,MLPerf 6.0已将DeepSeek-V3列为大规模预训练基准测试,这更凸显了其研究价值。
本系列的目标是:首先构建DeepSeek-V3的屋顶线模型(Roofline Model)——一种极度简化的性能近似模型,用于揭示我们理论上能达到的"光速级"最优性能。随后,我们将逐步引入现实世界中的各种修正因子,不断优化这个模型,最终使其能够合理预测实际运行PyTorch性能追踪(profile trace)时的表现。届时,我们将能理解NVIDIA在其MLPerf提交中为何选择特定的性能配置,也能在计划预训练DeepSeek-V3时,全面权衡不同方案的优劣。
