爱可可-爱生活
26-06-30 05:20 微博认证:AI博主 2025微博新锐新知博主

[IR]《Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation》Y Chen, X Wu, J Duan, M Liang,… [Meta AI & University of North Carolina at Chapel Hill] (2026)

在离散扩散语言模型(dLLMs)领域,如何平衡生成质量与推理效率是一个悬而未决的难题。过去的方法受困于“性能-速度”的二律背反,本质原因是双向注意力机制虽能提供全文本信息但无法兼容 KV Cache 导致吞吐量骤降,而因果注意力机制虽快却因缺失右侧上下文导致生成质量严重下滑。

本文的核心洞见是:将双向上下文的处理进行非对称化解耦,把右侧上下文重新看作一种可压缩的残差修正信号。由此,引入轻量化的逆向 Mamba 状态空间模型作为“侧车”,在不破坏主干网络因果注意力及 KV Cache 兼容性的前提下,通过反向扫描为每个位置补偿缺失的未来信息。

这项工作真正留下的遗产是开创了“双焦扩散”(Bifocal Diffusion)范式,证明了异步非对称架构能以极低的计算成本打破 Transformer 结构性的信息限制。它为后来者打开的新门是利用非注意力机制(如 SSM)增强现有自回归模型的并行解码能力,但尚未跨过的门槛是在超大规模参数量及更复杂长文本任务中,这种压缩后的右侧上下文是否依然能完美替代全量双向注意力。

arxiv.org/abs/2606.27732 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京