小册子 理解量化。
作者Tech with Mak(id :techNmak),内容发群里了(原地址在google drive):http://t.cn/AXIQZSlJ
“我整理了一本手册,详解量化实际如何运作,从仿射整数量化入手,阐述如何借助缩放因子、零点、舍入、截断以及不同的量化粒度,将浮点数值映射到更小的可表示编码集合中。
手册系统讲解了对称与非对称量化、按张量/按通道/按组缩放、校准、PTQ 与 QAT、仅权重量化与激活量化、异常值、GPTQ、AWQ、SmoothQuant、LLM.int8()、NF4 与 QLoRA、FP8、KV 缓存量化、KIVI、KVQuant,以及让低精度真正实用的内核与硬件层面内容。
编写这本手册的初衷,是希望提供我当初初次尝试理解“4-bit 模型”究竟指代什么时,所渴望得到的解释,并阐明为何减少位数可以降低内存占用,却未必能自动提升推理速度。”
发布于 山东
