AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
互信息
1 篇相关内容
相关话题
大语言模型
偏好对齐
多目标优化
AI安全
基于互信息的多目标探索与偏好优化新框架MI-EPO
研究人员提出MI-EPO框架,通过最大化生成回复、偏好反馈和偏好向量之间的联合条件互信息,统一多目标探索与对齐过程,显著提升大模型与多样化人类价值观的匹配度。
a
arXiv
·
18 天前
大语言模型
偏好对齐
多目标优化
互信息
a