爱可可-爱生活
25-11-24 05:26 微博认证:AI博主 2025微博新锐新知博主

[LG]《On the Fundamental Limits of LLMs at Scale》M A Mohsin, M Umer, A Bilal, Z Memon... [Stanford University & The University of Oklahoma] (2025)

大语言模型(LLM)虽因规模扩展而能力大增,却面临五大根本极限:幻觉(hallucination)、上下文压缩(context compression)、推理退化(reasoning degradation)、检索脆弱(retrieval fragility)与多模态错配(multimodal misalignment)。这些现象非单纯工程问题,而是由计算理论、信息论与统计学习的内在限制决定。

一、幻觉不可避免。基于可计算性理论,任何可枚举模型集合必在某些输入上出错(对角线界限);不可判定问题(如停机问题)导致无限失败;有限信息容量和压缩限制亦引入必然误差。训练数据的不足、噪声、长尾事实稀缺、时间衰减和冲突信息加剧幻觉。现有评测体系惩罚“我不知道”,奖励自信猜测,导致模型倾向自信编造。创意与准确性本质对立:创造新颖输出不可避免带来更多幻觉。

二、上下文压缩限制。尽管训练时支持超长上下文(如128K tokens),但因训练数据位置分布偏左、位置编码周期性和衰减、以及softmax注意力的“拥挤”效应,模型实际有效利用的上下文远低于名义长度。注意力机制需要对相关信息赋予对数级数的边际优势,否则在大量无关信息中信号被稀释。

三、推理退化。LLMs优化的是下一个词的概率,奖励局部连贯而非逻辑推导,导致推理路径“可有可无”、中间步骤非因果,且容易受知识注入的虚假相关影响。搜索策略和推理接口的脆弱性进一步削弱推理质量。解决方案包括基于验证的一致性约束、程序辅助语言模型(PAL)、链式验证(CoVe)与神经符号集成。

四、检索脆弱。检索增强生成(RAG)受限于有限上下文窗口,必须在检索结果的相关性与覆盖度间权衡;文档切分和排序噪声导致信息碎片化和语义漂移;对抗攻击能通过少量“投毒”文档扰乱检索结果,严重威胁系统安全。模型对检索结果的过度信任及注意力分配不合理,使得错误信息被强化,难以纠正。

五、多模态错配。视觉等非语言模态通过投影层映射至语言模型空间,导致表示不平衡和语义失真,语言主导梯度更新,视觉信息被压缩且丢失细节。视觉编码与文本编码的统计分布差异引发语义漂移,融合机制如注意力瓶颈限制了跨模态信息容量。多模态模型仍受限于单模态的理论极限,且存在交叉模态幻觉和认知过拟合现象。规模扩大并未根本缓解这些问题,反而放大了错配风险。

此外,当前评测存在数据污染、评分者偏差、忽视计算成本与效率、结果不稳定及公平性缺失等问题,掩盖了LLM能力的真实上限。

未来方向应聚焦:量化内在失败下界、构建可信的选择性预测系统和污染审计基准、设计长上下文与外部记忆架构、优化受限令牌预算下的检索策略,以及制定推理与多模态任务的统一目标,兼顾一致性、计算成本与创造性。

总之,LLM的失败根植于计算与信息的基本定律,不是简单的工程难题。认识并接受“失败的可预测性和不可避免性”,设计容错、透明且符合任务需求的系统,才是未来可持续发展的关键。

详细阅读请见arxiv.org/abs/2511.12869

发布于 北京