斌叔OKmath
26-09-04 08:03 微博认证:橙旭园CEO 教育博主

今天,我们在我们的推理引擎 uzu 中发布了推测解码实现。

最初支持 Qwen3.6 27B,即将支持 Qwen3.8 27B 和 Muse Glimmer。

在 Apple M5 系列芯片上,我们的性能比 MTPLX(MLX + 推测解码)高出近 2 倍,比 llama.cpp 高出超过 3 倍(在相当的量化级别下),在数学推理和编码任务上取得了最显著的提升。

运行模型:
Mirai-M: http://t.cn/AX0JTaLm…
Mirai-L: http://t.cn/AX0JTaLn…

探索基准测试:
http://t.cn/AX0JTaLd

了解更多关于我们的推测解码实现:
http://t.cn/AX0JTaLu…

我们的草稿模型、量化检查点格式、验证算法和 GPU 内核是从零开始围绕最新的 Apple M5 芯片共同设计的,以最大限度地利用 GPU 神经加速器。

与流行的推测解码架构不同,例如模型原生的 MTP,它一次生成 3-4 个令牌的小草稿链,我们使用极其激进的推测预算,即 16-32 个令牌。这使我们能够使用神经加速器支持的 GEMM 内核,实现硬件算术吞吐量的最大利用。

http://t.cn/AX0JTaLR

发布于 北京