SAGE-OPD:多轮策略蒸馏中的选择性干预新框架
在大型语言模型智能体训练中,策略蒸馏(OPD)通过让模型基于自身策略产生的轨迹进行训练,成为缓解暴露偏差的有效方法。然而现有研究多集中于单轮场景,而实际应用中智能体需要与环境进行多轮交互,早期错误会改变后续观察并沿轨迹累积,传统的密集词元级OPD方法在此场景下显得脆弱——可能过度惩罚语义有效的替代方案、强化局部退化行为(如重复动作),并在非分布历史中传播不可靠的教师监督。
针对这一挑战,研究团队提出SAGE-OPD框架,这是首个无需验证器的选择性干预方案,专门为多轮OPD设计。该框架不再对所有轮次统一施加教师监督,而是先观察环境反馈,利用教师判断决定是否跳过或干预学生的每个回应。为应对误差累积问题,SAGE-OPD引入教师置信度加权机制,降低不确定教师分布在受损或模糊历史中的影响。同时通过损失归一化技术,在保持标准OPD整体损失规模的同时保留轮次选择性加权。
在智能体任务上的实验表明,SAGE-OPD相比基线方法取得显著提升,在ALFWorld未见任务成功率上相对标准OPD提高13.3%。消融研究进一步证实,轮次级干预、教师置信度加权和损失归一化三者具有互补效益。这项研究揭示:有效的多轮OPD应保持策略一致性,但教师监督需要选择性地分配到必要且可靠的干预轮次,为复杂交互场景下的智能体训练提供了新思路。