#DeepSeek宣布开源DeepGEMM#重大突破!DeepSeek开源周再爆惊喜——DeepGEMM震撼登场
在AI技术飞速发展的当下,DeepSeek开源周的又一重磅成果——DeepGEMM,正以其独特的技术优势和创新理念,迅速吸引全球开发者的目光。
极致设计,引领性能飞跃
DeepGEMM是一款采用CUDA编写的FP8通用矩阵乘法库,其最大亮点在于全JIT编译设计。安装过程无需繁琐的预编译步骤,所有内核均实现动态生成,极大简化了运维流程。性能表现更是惊艳,在H800 GPU上,普通GEMM(M=64, N=2112, K=7168)计算性能高达206 TFLOPS,相比CUTLASS 3.6的优化实现,加速比达到2.7倍;MoE分组GEMM的加速比也稳定维持在1.1 - 1.2倍区间,展现出卓越的计算效率。
创新技术,夯实技术壁垒
为解决FP8计算精度难题,DeepGEMM首创CUDA核心二级累加机制,从底层优化计算逻辑。同时,支持非对齐块大小,显著提升SM利用率,搭配深度整合的Hopper TMA加速技术,实现数据异步传输与计算的高效重叠,大幅提升计算资源的利用效率。并且,其核心内核函数仅约300行代码,简洁明了,不仅方便开发者学习Hopper FP8矩阵乘法技术,也为后续的优化和拓展提供了清晰的框架。
开源共享,激发社区活力
DeepGEMM采用MIT许可证开源,代码托管于GitHub(github.com/deepseek-ai/DeepGEMM)。这一举措不仅为AI研究者提供了深入研究Hopper架构优化的宝贵范本,更为广大社区贡献者开辟了广阔的优化空间。通过开源,DeepGEMM有望加速AI技术在更多领域的应用落地,推动整个行业在计算层面的持续创新与发展。
从技术创新到开源共享,DeepGEMM正以实际行动践行“低成本、高性能”的发展路线,为AI领域注入新的活力与可能。无论是追求极致性能的企业,还是热衷于技术探索的开发者,都能在DeepGEMM中找到新的机遇与突破。
发布于 福建
