LAPO:多轮搜索推理中自生成过程奖励的新方法
在多轮搜索推理任务中,强化学习通常依赖最终结果奖励,这种方法无法区分中间交互步骤的有用性、冗余性和危害性。针对这一局限,研究团队提出了LAPO方法——一种基于后向单轮归因的自生成过程监督技术。
LAPO的核心创新在于:对于搜索过程中的每个轮次,该方法将该轮次及其检索观察替换为固定的[DELETE]占位符,然后测量当前策略对正确答案的平均对数似然变化。这种答案似然增益能够评估该轮次在整个推理上下文中的贡献,同时保留所有下游交互,使得早期证据能够在完整推理环境中得到评估。
该方法进一步应用符号一致性门控机制,仅保留方向与其原始归因分数一致的归一化过程优势。值得注意的是,LAPO无需额外的奖励模型、教师模型、验证器或LLM-as-a-Judge组件,实现了轻量级的过程监督。
在七个具有本地检索功能的知识密集型问答数据集上的实验表明,LAPO的平均精确匹配得分达到0.326,比最强的步骤奖励基线IGPO高出0.053。消融研究证实了后向归因和符号一致性门控的互补优势,证明基于策略的回顾性归因能够为多轮搜索智能体提供有效的过程监督。