电子书:何编写推理引擎:Muser 实战指南——Apple Metal 上的 Muse Glimmer、kvpack 与解耦式预填充
地址:highperformanceailab.com/muser-book/
“本书从头到尾讲解 Muser 推理引擎如何在 Apple Silicon 上,使用锁定版本的 Muse Glimmer 模型生成文本。该模型包含 52 层、约 300 亿个参数。引擎提供采用 kquant DFlash 推测解码的路径、原生 NVFP4 路径,以及一条解耦式路径:远程 NVIDIA GB10(“GX10”)节点在 vLLM 下以 NVFP4 格式完成预填充,再通过经过身份验证的 Handoff V2 传输协议,将 KV 缓存交给 Mac。书中引用的每一行 Metal 和 Rust 代码都取自锁定的源码树,每一个数字都会注明其测量来源。
这是一本从入门到进阶的书。一个概念第一次出现时,无论是 softmax、SIMD 组、半字节、残差流、旋转位置编码、KV 缓存页还是 NVFP4 数据块,都会先在原地给出定义、图示和计算示例,然后才用来解释 Muser 的代码。即使读者只熟悉 Rust,从未编写过 GPU 内核,也没有读过 Transformer 论文,读完全书后也应该能够理解:大模型推理背后的数学、让推理在 Apple Silicon 上加速的 Metal 实现、使远程预填充值得信任的精度规范,以及保证所有结论诚实可信的证据文化。
我们按照实际工作的方式写了这本书。当某一章遇到真实的技术选择时,我们不会直接给出获胜方案然后继续前进。我们会先展示岔路,说明尝试了什么、原本期待什么,让失败过程出现在书页上,指出失败教会了我们什么,最后才展示真正交付的方案。换句话说,那些死路不是被藏在附录里的忏悔;它们是推理过程变得可见的地方,也是最终方案值得信任的原因。书中每一个这样的故事都会引用当时保留的测试记录,供读者自行检查。
全书分为八个部分,首次阅读时建议按顺序进行:
问题与 Metal 计算模型:不要求 Transformer 基础,目标是让读者能够看懂书中的 Metal 着色器。
量化:解释约 300 亿个权重如何装进约 17 GB 的 GGUF 文件,以及不同执行路径付出的代价。
模型:介绍 Muse Glimmer 的 52 层计算图和完整前向传播。
解码路径:按照执行顺序逐一拆解内核,是全书的主干。
KV 缓存与 kvpack:讨论缓存的成本、布局,以及如何将其变成持久且可移植的资产。
解耦式执行路径:解释 Mac 与 GB10 为什么能够互补,以及信任远程预填充需要付出的代价。
编排与服务:说明大量层、内核和请求槽位如何由一个受控系统统一管理。
测量与证据:讨论怎样建立可信结论,也是使前七部分保持诚实的基础。
完成第一部分后,各个内核章节也可以作为独立参考资料使用。每章都会分别说明数学原理、内存访问模式、Rust 调度、Metal 着色器、实测取舍及参考文献。”
