AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
LLM对齐
1 篇相关内容
相关话题
偏好学习
DPO
采样优化
模型训练
LLM偏好对齐新思路:如何从海量生成结果中筛选最有价值的比较对?
研究团队提出一种优化LLM偏好对齐训练效率的新方法,通过智能筛选最有信息量的比较对,在相同标注预算下显著提升模型性能。
a
arXiv
·
31 天前
LLM对齐
偏好学习
DPO
采样优化
a