超越轨迹模仿:策略引导优化提升大模型推理能力
传统的大模型能力蒸馏方法通常依赖于模仿特定解题轨迹,这种轨迹级模仿容易导致模型记忆实例化步骤而非掌握可迁移的推理技能,限制了其在新问题上的泛化能力。针对这一局限,研究团队提出了策略引导策略优化框架。
该框架的核心创新在于用可复用的策略蒸馏替代实例级轨迹模仿。具体而言,SGPO从强模型的响应中提取结构化策略描述,并为每个问题构建自主推理和策略引导两种轨迹,使模型能够直接比较有无策略指导时的行为差异。
框架重点解决了两个关键问题:在“如何蒸馏”方面,采用词元级前向KL目标选择性地将策略条件引起的分布变化迁移到无引导策略中,并通过邻近约束确保训练稳定性;在“何时蒸馏”方面,自适应实例级加权机制在自主探索不足时加强引导,随着模型自身能力提升逐步减少干预。
在跨越两个模型系列的四个数学基准测试中,SGPO持续优于监督微调、同策略强化学习及混合策略基线方法。在Qwen2.5-7B-Instruct模型上,该方法比最强基线平均得分提升2.2个点。分析表明,前向KL目标提供了本质上具有选择性的蒸馏信号,其效果优于直接轨迹模仿,且策略蒸馏与基础模型能力呈现互补的扩展特性。