#DeepSeek发布DSpark#2026年6月27日,DeepSeek联合北京大学共同推出DSpark,一款全新大模型推测解码推理加速框架,配套开源项目DeepSpec完整开放论文、代码、权重,采用MIT开源协议免费商用/二次开发。
落地对象
已上线DeepSeek-V4-Flash、DeepSeek-V4-Pro线上服务引擎,同时兼容通义千问Qwen、Gemma等主流开源大模型,并非DeepSeek私有技术 。
解决行业核心痛点
传统大模型逐Token自回归生成:每输出一个文字就要完整跑一遍大模型,高并发场景下GPU算力空转、响应卡顿、服务成本高;过往Eagle3、DFlash等推测解码方案存在短板:草稿长度固定、长文本预测准确率暴跌、高负载算力浪费严重。
三大核心技术创新(DSpark核心亮点)
1. 半自回归草稿生成
并行主干快速批量产出候选词片段,搭配轻量级串行模块补充文本前后依赖,解决纯并行方案长候选大量失效问题;仅2层Transformer草稿模型效果超过5层DFlash。
2. 置信度动态调度验证
给每一个预生成Token打分预判核验通过率,自动舍弃大概率被驳回的无效片段,减少无意义算力消耗,不用全部草稿强制校验。
3. 硬件感知前缀调度
实时读取GPU显存、并发负载,动态调整每轮草稿校验长度,全局最大化吞吐量,高峰期提速衰减远小于同类方案。
实测性能数据(官方线上基准)
1. 单用户生成速度(同等并发量)
- DeepSeek-V4-Flash:提升60%~85%
- DeepSeek-V4-Pro:提升57%~78%
2. 整体服务吞吐量:对比传统MTP基线提升51%~400%,极端并发场景最高4倍吞吐;
3. 横向对比:数学、代码、对话、长文本场景,有效保留Token长度全面优于Eagle3、DFlash。
对行业的影响
1. 赛道转变:大模型竞争从“堆参数刷榜单”转向底层推理效率、算力成本优化;
2. 降本落地:同等GPU硬件可承载更多用户并发,企业AI服务算力支出大幅下降;
3. 开源普惠:全框架开放,中小厂商无需自研推理优化,快速提升自家模型响应速度;
4. 用户体验:AI对话、代码生成、长文写作告别逐字“蹦词”,输出丝滑无延迟。
适用场景与部署门槛
- 适用:ToC对话平台、代码助手、企业知识库、高并发API推理服务;
- 部署门槛:偏向企业/科研级,推荐8卡GPU集群,普通个人本地硬件很难发挥全部加速效果。
