斌叔OKmath
26-08-22 08:23 微博认证:橙旭园CEO 教育博主

RTX 4090 的压力测试真是相当疯狂。

Qwen3.8-27B Q4_K_XL 的上下文从 26K 推到 212K,使用 DFlash2 与原生 MTP 对比。

在 26K 时:
→ DFlash2:75.7 tok/s
→ MTP:68.1 tok/s

在 212K 时:
→ DFlash2:41.5 tok/s
→ MTP:37.6 tok/s

所以即使在 212K 令牌时,DFlash2 仍保持大约 10% 的吞吐量优势。

而且在那个超大上下文下,预填充速度仍保持在 1,200 tok/s 以上。

有趣的收获:

长上下文会损害吞吐量,但推测解码并不会突然崩溃。

一张 24GB 的单 RTX 4090 将 27B 模型通过 212K 令牌提示推送到 41+ tok/s,坦白说真是荒谬。

发布于 北京