RTX 4090 的压力测试真是相当疯狂。
Qwen3.8-27B Q4_K_XL 的上下文从 26K 推到 212K,使用 DFlash2 与原生 MTP 对比。
在 26K 时:
→ DFlash2:75.7 tok/s
→ MTP:68.1 tok/s
在 212K 时:
→ DFlash2:41.5 tok/s
→ MTP:37.6 tok/s
所以即使在 212K 令牌时,DFlash2 仍保持大约 10% 的吞吐量优势。
而且在那个超大上下文下,预填充速度仍保持在 1,200 tok/s 以上。
有趣的收获:
长上下文会损害吞吐量,但推测解码并不会突然崩溃。
一张 24GB 的单 RTX 4090 将 27B 模型通过 212K 令牌提示推送到 41+ tok/s,坦白说真是荒谬。
发布于 北京
