基于互信息的多目标探索与偏好优化新框架MI-EPO

arXiv·18 天前

随着大语言模型需要适配日益多样化和异质性的人类价值观,多目标对齐方法成为平衡冲突偏好维度的关键技术。现有方法通常通过训练基于偏好向量的策略并结合在线直接偏好优化来实现权衡,但探索不确定性可能导致不同偏好向量下生成回复的奖励分布重叠,使输出结果难以有效匹配对应偏好。

近日,研究团队在arXiv发表论文《Multi-Objective Exploration and Preference Optimization via Mutual Information》,提出基于互信息的多目标探索与偏好优化框架MI-EPO。该信息理论框架通过最大化生成回复、偏好反馈和偏好向量之间的联合条件互信息,将多目标探索与对齐过程统一起来。

MI-EPO创新性地引入概率路由机制,自然分解目标对齐和偏好感知探索两个子任务。这一设计鼓励模型生成既具有区分度又能精准对齐不同偏好条件的回复,有效解决了传统方法中响应与偏好向量匹配度不足的问题。

实验验证显示,在安全对齐和助手任务中,MI-EPO显著提升了生成回复与偏好向量的对齐精度,使模型输出更具可控性,并在多个目标间实现了稳定的权衡效果。该研究为大语言模型的多价值观对齐提供了新的理论框架和实践路径。

大语言模型偏好对齐多目标优化互信息AI安全

原文来源:https://arxiv.org/abs/2607.01392

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回