青稞AI
26-07-23 12:31 微博认证:AI博主

🔥draft model 怎么训练、DSpark 如何做动态 verify?从 EAGLE 到 DSpark,拆解最新的推测解码技术

我们已经在 OpenInfer[1] 的 Qwen3-4B 上支持 DFlash 和 DSpark 推测解码。单张 RTX 5090 的 ShareGPT 测试中,DSpark 把单流吞吐从 170 提高到 381 token/s,TPOT 从 5.83 ms 降到 2.96 ms;并发为 4 时,吞吐也从 576 提高到 1288 token/s,同时保持输出无损。

这篇文章会拆解推测解码技术本身:draft model 怎么训练,为什么 draft 和 verify 都不是越长越好,以及最新的 DSpark 是怎么做动态 verify 的。

大模型 decode 受限于内存带宽:每输出一个 token,都要把全部权重从显存完整读一遍。8GB 的 dense 模型、800GB/s 带宽,读一遍就是 10ms,单请求极限在 100 token/s。

这个上限和请求多少无关,请求复杂度无关,也和 kernel 写得好不好关系不大——带宽利用率无法超越物理极限,一次 forward 就要读取这么多数据。想更快,只有一个办法:让一次 decode forward 吐出不止一个 token。

阅读全文:http://t.cn/AX9XvM22

#青稞社区##人工智能[超话]##大模型#

发布于 河北