ATOD:多轮自主智能体训练新方法,融合蒸馏与强化学习优势

arXiv·22 天前

在训练面向长程交互任务的小型语言模型智能体时,传统方法面临效率与性能的平衡难题。策略蒸馏(OPD)虽能提供密集的教师指导,在训练初期快速提升模型能力,但当学生模型接近教师水平后,性能提升容易饱和。强化学习(RL)虽能通过环境奖励驱动模型探索更高性能上限,但稀疏延迟的反馈机制导致早期学习效率低下。

来自arXiv的最新研究提出ATOD(退火轮次感知策略蒸馏)算法,创新性地融合了两种训练范式的互补优势。该方案采用退火式OPD-RL调度策略:训练初期以OPD为主导,使学生模型快速逼近教师行为水平;随后逐步增强RL权重,驱动模型基于奖励信号进行探索性优化。

算法核心创新在于引入轮次级分歧-不确定性重加权机制(T-DUR),能够自适应增强长轨迹中高效用轮次的监督信号密度。在ALFWorld、WebShop和Search-QA三个交互任务基准上的实验表明,ATOD在不同规模学生模型上均取得显著提升:平均成功率较OPD提升3.03个百分点,较GRPO提升23.62个百分点,甚至超越对应教师模型2.16个百分点。

这项研究为资源受限场景下智能体训练提供了新思路,通过动态融合不同学习机制,在保证训练效率的同时突破了传统蒸馏的性能天花板。

模型训练强化学习知识蒸馏自主智能体多轮对话

原文来源:https://arxiv.org/abs/2606.27814

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回