协作强化学习新范式:让AI推理更易被人类理解
近期,强化学习与可验证奖励结合的技术显著提升了大语言模型的推理能力,使其在数学竞赛等领域达到专家甚至超人类水平。然而,这种强大能力是否能为较弱模型或人类所用仍存疑问,现有方法常导致推理过程可读性差、语言混杂等问题。
针对这一兼容性难题,研究团队提出Tandem强化学习新范式。该方法让训练后的强模型与冻结的弱模型协同生成推理过程,二者作为团队共同获得奖励,从而促使强模型采用弱模型也能理解的推理方式。实验将Qwen3-4B-Instruct模型应用于数学竞赛任务,发现该方法在保持单独推理能力的同时,显著提升了与弱模型的协作鲁棒性,减少了分布偏移,并产生了更易于理解的思维链。
这项研究为大模型在多智能体协作及人机交互中的实际应用开辟了新路径,未来有望缓解AI推理过程晦涩难懂的问题。