近期,线性注意力(linear attention)在大语言模型(LLM)设计中迎来新一波热潮。早在2020年代,线性注意力因将计算复杂度从O(n²)降至O(n)而备受关注,适合长序列处理,但准确率下降限制了其实际应用,鲜有顶尖开源模型采用。
今年下半年,MiniMax-M1、Qwen3-Next、DeepSeek V3.2等新模型相继推出,均采用线性或稀疏注意力替代传统的二次复杂度注意力层,显著提升效率。值得注意的是,MiniMax M2却回归传统全注意力,原因在于线性注意力在多轮推理和复杂任务中表现欠佳,牺牲了关键的准确性。
然而,Kimi团队最新发布的Kimi Linear模型采用混合注意力策略,将轻量级线性注意力与重型全注意力结合,比例为3:1。其创新点在于引入“Delta Attention”机制的改进版本Kimi Delta Attention(KDA)和多头潜在注意力(multi-head latent attention),在保持准确率的同时,实现了75%键值缓存减少和高达6倍的解码速度提升。
这表明线性注意力不是简单的“效率换准确率”,而是通过巧妙架构设计和动态权衡,逐步实现效率与性能的平衡。不同应用场景对速度和准确率的需求不同,混合策略为实际部署提供了灵活选择。
未来,线性注意力及其变种有望破解长上下文处理的瓶颈,推动智能代理等复杂任务的发展。它代表了从单纯算力堆砌向结构优化转变的趋势,是LLM架构进化的重要里程碑。
更多详解与对比见:x.com/rasbt/status/1984617030356451642
发布于 河北
