新智元
25-04-27 17:02 微博认证:新智元官方微博

莱斯大学等机构的研究人员提出了一种全新的无损压缩框架——动态长度浮点数(DFloat11),它能够将LLM的大小减少30%,同时确保输出结果与原始模型逐位相同。

为了支持使用动态长度编码进行高效推理,团队专门开发了一个定制的GPU内核,用于实现快速的在线解压缩:

1. 将内存密集型的查找表 (LUT) 分解为更紧凑的LUT,使其能够完全放入GPU的SRAM中;

2. 一个双阶段内核,利用轻量级的辅助变量来协调线程的读写位置;

3. Transformer Block级的解压缩,从而最大限度地降低延迟。

在Llama-3.1、Qwen-2.5、Gemma-3等SOTA模型上的实验表明, DFloat11除了能有效压缩模型的大小之外,同时还能保持完全一致的输出结果。

论文地址:http://t.cn/A6dZaYns