语言模型能否胜任百万级文档检索?注意力稀释成关键挑战

arXiv·18 天前

传统检索系统通常依赖向量匹配,而语言模型提供了一种新思路:通过直接理解上下文语料生成答案。然而,此前研究多集中于小规模重排任务或闭源系统,对海量文档的上下文检索潜力尚未充分挖掘。

最新研究首次系统评估了语言模型在百万令牌级语料下的检索性能,并关注其长度泛化能力——即处理远超训练时文档规模的能力。团队提出BlockSearch模型,这是一个6亿参数的检索专用语言模型,通过架构与训练优化,其长度泛化能力达到训练数据的10倍。但研究发现,当文档规模极端扩展时,检索性能仍会崩溃。

关键问题被归结为“注意力稀释效应”:随着语料库扩大,无关文档在注意力softmax分母中占据主导,即使目标文档的原始得分很高,其归一化权重也会被稀释。为此,研究团队引入长度感知的注意力softmax调整和文档级稀疏注意力机制。改进后的模型在MS MARCO、NQ等基准测试中达到与稠密检索相当的水平,且以七分之一参数量超越同期模型MSA。在需要不同相似性概念的LIMIT任务中,其表现更是显著优于传统方法。

这项研究为上下文检索作为传统检索的替代方案提供了实证支持,同时指出极端上下文扩展下的注意力控制是未来重要研究方向。

语言模型信息检索注意力机制上下文学习长文本处理

原文来源:https://arxiv.org/abs/2607.01538

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回