ATOD:多轮自主智能体训练新方法,融合蒸馏与强化学习优势
在训练面向长程交互任务的小型语言模型智能体时,传统方法面临效率与性能的平衡难题。策略蒸馏(OPD)虽能提供密集的教师指导,在训练初期快速提升模型能力,但当学生模型接近教师水平后,性能提升容易饱和。强化学习(RL)虽能通过环境奖励驱动模型探索更高性能上限,但稀疏延迟的反馈机制导致早期学习效率低下。
来自arXiv的最新研究提出ATOD(退火轮次感知策略蒸馏)算法,创新性地融合了两种训练范式的互补优势。该方案采用退火式OPD-RL调度策略:训练初期以OPD为主导,使学生模型快速逼近教师行为水平;随后逐步增强RL权重,驱动模型基于奖励信号进行探索性优化。
算法核心创新在于引入轮次级分歧-不确定性重加权机制(T-DUR),能够自适应增强长轨迹中高效用轮次的监督信号密度。在ALFWorld、WebShop和Search-QA三个交互任务基准上的实验表明,ATOD在不同规模学生模型上均取得显著提升:平均成功率较OPD提升3.03个百分点,较GRPO提升23.62个百分点,甚至超越对应教师模型2.16个百分点。
这项研究为资源受限场景下智能体训练提供了新思路,通过动态融合不同学习机制,在保证训练效率的同时突破了传统蒸馏的性能天花板。