FCPRAG:融合控制器参数化检索增强生成,实现稳定多段落知识注入
参数化检索增强生成(PRAG)通过段落特定的LoRA适配器将检索证据注入大语言模型,减少对长上下文提示的依赖。然而当同一查询检索到多个段落时,证据层面的融合成为瓶颈:等权重合并可能放大弱证据或矛盾证据,而将检索信号转换为融合权重通常需要脆弱的全局调优。
研究团队提出FCPRAG框架,这是一种融合控制的参数化RAG框架,通过添加轻量级控制器实现检索条件化的样本级适配器融合。该控制器预测每个段落的融合分数以及样本级校准信号,包括混合门和自适应温度参数,使融合在信息丰富的检索信号下保持选择性,在不确定性下保持保守。
FCPRAG采用合并感知监督进行训练,该监督源自每个适配器在多适配器合并中的边际贡献,仅使用训练数据。研究进一步表明,在异方差检索不确定性下,单一数据集级温度参数是次优的,因此需要样本级自适应。
在HotpotQA、2WikiMultiHopQA、PopQA和ComplexWebQuestions四个数据集上,基于三种大语言模型骨干网络的实验表明,FCPRAG在F1分数上持续优于标准RAG和参数化RAG基线,在2WikiMultiHopQA上提升达4.65%,在CWQ上提升达7.55%,同时降低了调优成本并提高了检索扰动下的鲁棒性。