Qwen3.8-Flash 现在变得快得多了。
MTP 已登陆 llama.cpp (WIP)!!
而且我在我的 3090 上获得了它的好处 🥳
@UnslothAI llama.cpp 分支已支持 MTP,并且使用他们的 MTP shared-draft 文件,我运行了 Qwen3.8-Flash-Next-IQ3_XXS 量化版本。
相同的标志:
-ncmoe 34
-ngl 999,
- kv at q8_0
- draft: mtp-Qwen3.8-Flash-Next-shared-Q4_K_M.gguf
- n-max 3
在我的 3090 + 64GB RAM 上的结果:
解码平均速度(无 -> MTP)
- 16k: 33 t/s -> 32 t/s
- 32k: 29 t/s -> 39 t/s
- 64k: 23 t/s -> 38 t/s
峰值解码获得了巨大改进:
- 8K: 37 -> 43 t/s
- 16K: 35 -> 38 t/s
- 32K: 30 -> 42 t/s
- 64K: 24 -> 48 t/s
VRAM:
21.5GB -> 23.3GB (+1.8GB)
在 64k 时,平均解码速度从 23 跃升至 38t/s,而峰值达到 48 t/s
有趣的部分是我获得了多少 t/s 提升,我现在将用不同的 n-max 进行测试,并将带来更多结果。
这对 3090 来说是个相当疯狂的飞跃!
Get the drafter here, also make sure to read instructions.
http://t.cn/AX0G8tYj
发布于 北京
