DeepSeek和北京大学团队联合发布了一篇重磅论文,正式推出全新的大模型推理加速框架DSpark,这套方案已经实打实地进入了DeepSeek-V4-Flash preview和DeepSeek-V4-Pro preview的生产服务系统,直接替代了之前使用的MTP-1方案,不是实验室里的理论模型,而是已经跑在真实用户流量上的成熟技术。
从实际表现来看,在系统总吞吐水平完全相同的前提下,DSpark让DeepSeek-V4-Flash的单用户生成速度提升了60%到85%,DeepSeek-V4-Pro也拿到了57%到78%的速度涨幅,用户能明显感受到回复变快了,但服务端的整体资源消耗并没有增加。
技术层面DSpark依然走的是推测解码路线,先由草稿模型生成候选token,再让目标模型并行验证,但这次的核心创新在于把半自回归生成和置信度调度结合到了一起,专门针对草稿阶段本身的延迟做了优化,让草稿生成更快更准,验证环节的效率也跟着提上来,不会因为草稿质量差导致反复重跑。
这次产学研联合落地的速度相当快,从论文发布到直接替换生产环境方案一步到位,后续随着DSpark在更多DeepSeek模型上铺开,大模型推理的响应体验还会继续往上走。
#DeepSeek发布DSpark#
发布于 福建
