#DeepSeek发布DSpark# DeepSeek联合北京大学正式发布DSpark推理加速框架,并已部署于DeepSeek-V4系列预览版,相关代码与模型检查点已在GitHub开源。
⚙️ 核心亮点:推理速度提升60%-85%
在高并发场景下,相比单token推测解码基线MTP-1,DSpark在同等吞吐量下可将单用户生成速度提升60%至85%。
🔬 技术原理:两大关键创新
· 半自回归生成架构:结合并行生成的高吞吐与串行模块的依赖建模,解决并行草稿模型在长候选块上接受率衰减的问题。
· 置信度调度验证:引入置信度头评估每个候选token的"存活概率",动态决定验证长度,避免计算资源浪费在大概率被拒绝的"尾部token"上。
📦 开源配套:全栈框架DeepSpec
同步开源了用于训练和评估推测解码草稿模型的全栈代码库DeepSpec,内置DSpark、DFlash、Eagle3三种算法,并支持在Qwen3和Gemma等系列模型上进行定制化训练。不过需要注意,以默认配置训练为例,目标缓存体积可能高达约38TB,部署前需充分评估存储资源。
http://t.cn/AXSQIIPW http://t.cn/AXSQITgw
发布于 河南
