LLM偏好对齐新思路:如何从海量生成结果中筛选最有价值的比较对?
在大型语言模型的偏好对齐训练中,传统方法通常为每个提示生成少量补全结果,并对所有比较对进行人工标注。然而,人工标注成本远高于生成更多补全结果,这促使研究者重新思考如何更高效地利用标注预算。
最新研究将比较对筛选问题形式化为采样设计问题,通过分析直接偏好优化(DPO)训练过程,揭示了比较对选择如何影响最终策略性能。研究团队推导出DPO训练策略最优性差距的上下界,发现比较选择通过一个设计依赖的信息矩阵影响下游性能,该矩阵将标签分配与参数估计误差和策略次优性联系起来。
基于这一理论框架,研究者提出了预算约束下的比较对筛选优化准则,并设计了实用的采样方法,能够从大规模生成结果池中筛选出信息量最大的比较对。实验表明,在合成场景和语言模型对齐基准测试中,该方法相比常见的启发式选择策略,能够持续提升样本效率,为降低对齐成本提供了新思路。
这项研究为偏好对齐训练的数据收集策略提供了理论指导和实用工具,有望推动更高效、更经济的语言模型对齐方法发展。