#DeepSeek新发布的DSpark有多强#
昨天DeepSeek联合北大甩出的DSpark,在AI圈炸出了不小的水花。花几分钟看懂它到底做了件什么事。
不堆显卡,纯靠软件“提速”
DeepSeek这次发的不是新模型,是一个推测解码框架。
大模型生成文字是一个字一个字往外蹦的,每蹦一个字都要跑一次完整计算,这就是AI回复慢的根源。业界有个思路叫“推测解码”——用小模型先“猜”几个字,再让大模型一次性验证,猜对了就直接收下。
但现有方案各有硬伤。自回归草稿模型猜得准但猜得慢;并行草稿模型猜得快但猜不准,经常出现“of course”和“no problem”混成“of problem”这种语义崩塌。高并发时把猜错的部分送去验证,白白浪费算力。
DSpark的两把刀正好砍在这两个痛点上:
第一把刀:半自回归架构。保留并行模型“一次生成一整块”的速度,但在后面接了一个极轻的顺序模块,把“前一个词是什么”的信息注入进来。两层Transformer的效果,超过了五层传统并行模型。
第二把刀:置信度调度验证。给每个猜出来的词打分,预测它“存活”的概率。系统根据当前负载动态决定验证多少个词——闲时多验几个,忙时只验最靠谱的。MTP-1基线固定验证2个token,DSpark可以动态扩展到4到6个。
开源且兼容主流模型
DSpark采用MIT协议全栈开源。已经过通义千问3、Gemma4等主流模型在数学推理、代码生成、日常对话三大场景的验证。配套的DeepSpec仓库包含完整的训练代码和评估工具。
对缺乏底层算法团队的中小企业来说,不需要投入巨额研发就能复用这套方案。
三个值得关注的点
第一,软件优化思路能否成为趋势?当行业都在卷参数、堆显卡的时候,DeepSeek用纯软件方案把速度提了上去。推理成本降低,直接受益的是应用层——Agent、代码助手、实时对话这些场景,响应速度每快一秒,体验就差一个档次。
第二,开源兼容能否被行业跟进?DSpark已经在Qwen和Gemma上验证了泛化能力。这套方案如果被更多厂商采纳,大模型推理的“公用基础设施”可能正在形成。
第三,创始人亲自署名论文。完成首轮融资后,梁文锋依然亲自参与技术论文撰写,这在AI行业并不多见。
