张岱樾
26-06-29 16:27 微博认证:AI博主

#DeepSeek新发布的DSpark有多强#

昨天DeepSeek联合北大甩出的DSpark,在AI圈炸出了不小的水花。花几分钟看懂它到底做了件什么事。

不堆显卡,纯靠软件“提速”

DeepSeek这次发的不是新模型,是一个推测解码框架。

大模型生成文字是一个字一个字往外蹦的,每蹦一个字都要跑一次完整计算,这就是AI回复慢的根源。业界有个思路叫“推测解码”——用小模型先“猜”几个字,再让大模型一次性验证,猜对了就直接收下。

但现有方案各有硬伤。自回归草稿模型猜得准但猜得慢;并行草稿模型猜得快但猜不准,经常出现“of course”和“no problem”混成“of problem”这种语义崩塌。高并发时把猜错的部分送去验证,白白浪费算力。

DSpark的两把刀正好砍在这两个痛点上:

第一把刀:半自回归架构。保留并行模型“一次生成一整块”的速度,但在后面接了一个极轻的顺序模块,把“前一个词是什么”的信息注入进来。两层Transformer的效果,超过了五层传统并行模型。

第二把刀:置信度调度验证。给每个猜出来的词打分,预测它“存活”的概率。系统根据当前负载动态决定验证多少个词——闲时多验几个,忙时只验最靠谱的。MTP-1基线固定验证2个token,DSpark可以动态扩展到4到6个。

开源且兼容主流模型

DSpark采用MIT协议全栈开源。已经过通义千问3、Gemma4等主流模型在数学推理、代码生成、日常对话三大场景的验证。配套的DeepSpec仓库包含完整的训练代码和评估工具。

对缺乏底层算法团队的中小企业来说,不需要投入巨额研发就能复用这套方案。

三个值得关注的点

第一,软件优化思路能否成为趋势?当行业都在卷参数、堆显卡的时候,DeepSeek用纯软件方案把速度提了上去。推理成本降低,直接受益的是应用层——Agent、代码助手、实时对话这些场景,响应速度每快一秒,体验就差一个档次。

第二,开源兼容能否被行业跟进?DSpark已经在Qwen和Gemma上验证了泛化能力。这套方案如果被更多厂商采纳,大模型推理的“公用基础设施”可能正在形成。

第三,创始人亲自署名论文。完成首轮融资后,梁文锋依然亲自参与技术论文撰写,这在AI行业并不多见。

发布于 广东