蚁工厂
26-09-07 08:22 微博认证:科技博主

小册子: 理解KV 缓存 -- 从自回归解码到现代大语言模型推理
作者:Tech with Mak
翻译:轩辕之风
原链接做google drive不好分享,发群里了:http://t.cn/AXIQZSlJ ​​​​

KV 缓存很容易被解释得不准确。人们常把它称为“大语言模型的记忆”“一种提速技巧”,或干脆称作“缓存起来的注意力”。这些简略说法掩盖了真正重要的机制。
本手册从基本原理出发构建这一概念。读完之后,你应该能够解释:
• 为什么在普通的因果 Transformer 中,过去的键和值可以复用;
• 缓存中究竟存储了哪些张量,以及它们的形状如何增长;
• 为什么缓存的内存占用与缓存 token 数、层数、KV 头数、头维度,以及每个元素的字节数成线性关系;
• 为什么 MQA、GQA 和 MLA 以不同的方式降低 KV 成本;
• 为什么在并发推理服务中,缓存管理会成为一个系统问题;
• PagedAttention、前缀缓存、卸载,以及 KV 缓存量化究竟改变了什么。

发布于 山东