Shapley上下文剪枝:基于合作博弈论的RAG系统优化新框架
在检索增强生成系统日益普及的背景下,如何高效处理检索到的上下文成为关键挑战。现有方法多依赖启发式损失函数和经验性归因,缺乏统一的理论框架。arXiv最新研究提出Shapley上下文剪枝框架,创新性地将上下文建模为合作博弈,利用沙普利值理论进行重要性归因。该方法采用Deep Sets架构实现句子级排列不变性,以预训练语言模型作为句子编码器,通过成对边际排序损失进行优化。为确保实际可扩展性,研究团队引入蒙特卡洛采样进行高效训练和推理,并提供保留Top-K子集排名的理论误差界和样本复杂度保证。实验涵盖支持句召回、大海捞针评估、长上下文问答和多跳推理等多个维度,同时进行了嵌入质量和归因策略的严格消融研究。与现有基线相比,该模型在下游问答任务中表现出竞争力,为RAG系统的优化提供了新的理论视角和实践方案。