[LG]《CDLM: Consistency Diffusion Language Models For Faster Sampling》M Kim, C Xu, C Hooper, H Singh... [Seoul National University & UC Berkeley] (2025)
在大语言模型(LLMs)领域,扩散语言模型(DLMs)以并行生成多token的潜力引发关注,但其推理速度慢、无法利用标准KV缓存成为瓶颈。本文提出了一种创新训练加速方法——CDLM(Consistency Diffusion Language Models),通过一致性建模和块状因果注意力掩码的结合,显著提升推理效率。
核心创新包括:
1. 一致性引导蒸馏:CDLM定义了token级别的解码轨迹,结合来自全双向教师模型的知识蒸馏,指导学生模型在每一步多token最终确定,提升收敛速度和稳定性。
2. 缓存友好的块状因果结构:通过在微调阶段引入块状因果注意力掩码,CDLM兼容KV缓存机制,支持块级缓存和块边界早停,极大减少计算冗余。
3. 端到端推理加速:实验证明,CDLM在数学和编程任务上,推理延迟降低3.6至14.5倍,采样步数减少3.4至7.9倍,同时保持竞争力的准确率;在吞吐量上超越同尺寸自回归模型。
方法细节:
- 教师模型采用全双向注意力,生成高质量的token解码轨迹及隐藏状态缓冲区。
- 学生模型采用块状因果注意力,仅关注上下文和当前块,支持KV缓存。
- 训练目标融合蒸馏损失(模拟教师多token预测)、一致性损失(保持块内状态一致)和标准掩码去噪损失,确保模型多步跳跃预测稳定。
- 推理时采用置信度阈值并行解码,结合块边界早停机制,兼顾速度与质量。
实验证明,CDLM不仅大幅减少采样步数,降低推理延迟,还能提升生成速度(tokens/s),在数学推理和代码生成等多个公开基准上表现优异。相比传统DLM和现有加速方法,CDLM在效率和准确率间实现了更佳平衡。
此外,CDLM具备良好的扩展潜力,可结合其他推理加速技术,如跨块并行和推测解码。未来方向包括扩大训练数据规模、拓展领域覆盖及从更强大的教师模型蒸馏,以进一步提升性能。
这项工作为扩散语言模型实用化铺平道路,突破了其推理速度瓶颈,展示了结合一致性建模与块状因果结构的巨大潜力。
原文:arxiv.org/abs/2511.19269
