爱可可-爱生活
26-07-04 05:39 微博认证:AI博主 2025微博新锐新知博主

[CL]《Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale》S Gollapudi, N Gupta, P Singhal, S Min [UC Berkeley & UT Austin] (2026)

在长文本大模型领域,利用上下文进行百万级 Token 规模的直接检索(ICR)是一个悬而未决的难题。过去的方法受困于模型规模或仅限于小范围重排序,本质原因是随着语料库增长,注意力稀释效应会导致正确文档的得分被大量无关文档的噪声淹没。

本文的核心洞见是:把检索失败重新看作是 Softmax 归一化过程中的概率质量坍塌,而非模型排序能力的丧失。由此,引入长度感知注意力调整(SSMax)与文档级稀疏路由这一关键操作,通过动态缩放预 Softmax 分数和剪枝无关文档,使模型在百万级维度下仍能精准锁死目标。

这项工作真正留下的遗产是证明了小参数模型(0.6B)通过架构微调,在复杂语义检索上可超越大 7 倍的竞争对手并比肩向量检索。它为后来者打开的新门是摆脱传统向量数据库、实现原生长文本检索的可能性,但尚未跨过的门槛是彻底消除极端长度下的性能衰减。

arxiv.org/abs/2607.01538 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京