AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多目标优化
2 篇相关内容
相关话题
大语言模型
偏好对齐
互信息
AI安全
推荐系统
强化学习
信息茧房
公平性
基于互信息的多目标探索与偏好优化新框架MI-EPO
研究人员提出MI-EPO框架,通过最大化生成回复、偏好反馈和偏好向量之间的联合条件互信息,统一多目标探索与对齐过程,显著提升大模型与多样化人类价值观的匹配度。
a
arXiv
·
18 天前
大语言模型
偏好对齐
多目标优化
互信息
a
打破信息茧房:语义帕累托DQN框架实现多目标推荐
研究者提出一种多目标强化学习框架,将推荐系统建模为语义多目标马尔可夫决策过程,通过帕累托DQN智能体平衡用户参与度、信息多样性和内容公平性。
a
arXiv
·
27 天前
推荐系统
强化学习
多目标优化
信息茧房
a