SGLang发了篇技术博客,介绍它们的推理引擎是如何支持DeepSeek-V4.1及如何做性能调优的,
www.sglang.io/blog/deepseek-v4.1-flash-kernel-optimization
“SGLang 团队为 DeepSeek-V4.1 Flash 提供了首日支持并一同完成了内核优化。在 4×GB300 平台上,批量大小 BS=1 的普通解码速度从我们首个可用版本的 35 tokens/s 提升到了 203 tokens/s。开启 DSpark 后,我们持续优化了验证、MoE 以及小批量投影,并将 MoE 迁移至支持填充的 TP4 模式。最终配置为:注意力 TP4、MoE TP4(EP1),输入随机令牌数为 4096,输出令牌数为 1024,模拟接受长度固定为 5.5,在 BS=1 时可达 873.63 tokens/s。本文将介绍该模型架构的改动细节,以及各项内核优化的实现方式。”
发布于 山东
