语言模型新训练法:过程记忆蒸馏让AI学会自我反思与进化
当前基于可验证奖励的强化学习及其自蒸馏变体通常只利用回合级别的验证信号更新策略,忽略了训练过程中产生的丰富过程信息。模型在不同回合和训练周期中会遇到相似问题,产生跨回合信号,但这些信号很少被保留或重用。
来自arXiv的最新研究提出过程记忆蒸馏方法,旨在解决这一局限。该方法将跨回合的训练信号转化为可重用的过程记忆,并在训练过程中将其蒸馏到策略权重中。这种记忆作为训练支架发挥作用,最终被吸收到模型参数内部,推理时无需额外记忆模块。
PMD在三个抽象层次组织记忆:原始轨迹、自我反思的策略与经验教训、以及跨问题重复出现的高级行为模式。所有这些信息都从模型自身生成的轨迹中在线提取。一个基于记忆条件的自我教师利用积累的经验监督学生模型在其自身轨迹上的表现,使学生能够逐步将过程知识内化到参数中。
核心设计原则是协同进化:策略生成更新记忆的轨迹,而记忆则塑造更新策略的监督信号。实验表明,在Qwen3-8B和OLMo3-Instruct-7B模型上,PMD在SCIKNOWEVAL基准上比SDPO提升3.8-5.5%,在LIVECODEBENCH上提升7.9-13.6%。协同进化的有效性得到验证:冻结记忆或策略任一组件都会导致性能下降超过10%。