【#DeepSeek发布DSpark#,高并发下生成速度提升超60%】
据IT之家报道,今日,DeepSeek联合北京大学正式发布DSpark推理加速框架,旨在解决大语言模型在高并发生产环境中的推理效率瓶颈。
该框架已部署于DeepSeek-V4-Flash与DeepSeek-V4-Pro的预览版服务引擎中,相比此前生产环境采用的单token推测解码基线MTP-1,在同等吞吐量水平下可将单用户生成速度提升60%至85%。相关论文、训练代码及模型检查点已在GitHub平台DeepSpec项目中开源。
大语言模型生成文本时采用自回归方式,每生成一个新token都需要一次完整的前向传播,推理延迟随输出长度线性增长,这是目前AI对话系统响应偏慢的核心原因之一。
推测解码技术提供了一条解决路径:用一个轻量级的小模型快速生成若干候选token,再由完整规模的大模型通过单次并行前向传播进行批量验证,接受其中符合目标分布的连续前缀。由于验证阶段可并行计算,且拒绝采样机制严格保证了输出分布与原始模型一致,推测解码能够在无损生成质量的前提下提升速度。
