语言模型能否胜任百万级文档检索?注意力稀释成关键挑战
传统检索系统通常依赖向量匹配,而语言模型提供了一种新思路:通过直接理解上下文语料生成答案。然而,此前研究多集中于小规模重排任务或闭源系统,对海量文档的上下文检索潜力尚未充分挖掘。
最新研究首次系统评估了语言模型在百万令牌级语料下的检索性能,并关注其长度泛化能力——即处理远超训练时文档规模的能力。团队提出BlockSearch模型,这是一个6亿参数的检索专用语言模型,通过架构与训练优化,其长度泛化能力达到训练数据的10倍。但研究发现,当文档规模极端扩展时,检索性能仍会崩溃。
关键问题被归结为“注意力稀释效应”:随着语料库扩大,无关文档在注意力softmax分母中占据主导,即使目标文档的原始得分很高,其归一化权重也会被稀释。为此,研究团队引入长度感知的注意力softmax调整和文档级稀疏注意力机制。改进后的模型在MS MARCO、NQ等基准测试中达到与稠密检索相当的水平,且以七分之一参数量超越同期模型MSA。在需要不同相似性概念的LIMIT任务中,其表现更是显著优于传统方法。
这项研究为上下文检索作为传统检索的替代方案提供了实证支持,同时指出极端上下文扩展下的注意力控制是未来重要研究方向。