多智能体融合新框架:让大模型更懂人类价值观的多样性

arXiv·23 天前

大语言模型如何与多元人类价值观对齐仍是AI可信化的重要挑战。现有方法如RLHF、CAI等多采用单智能体框架和统一奖励机制,难以捕捉伦理多元性、适应不同道德情境,也无法反映多智能体道德推理的动态特性。

近日,研究人员在arXiv发表新论文,提出多层组合融合上下文价值对齐框架MCF-CVA。该框架在第一层实例化多个道德智能体,每个智能体微调后代表特定价值观。随后通过分数组合与排名组合、平均与加权聚合等方式对输出进行组合扩展,再将组合模型缩减至初始道德智能体数量。这种扩展-缩减过程在多层中迭代,直至满足停止条件。

MCF-CVA框架利用智能体间的认知多样性,缓解多智能体间的冲突与冗余,生成更贴合上下文人类价值观的回应。框架基于欧几里得分数空间和Kemeny排名空间的双重架构运行EAR算法。实证评估表明,该框架在标准指标上优于单智能体基线、多智能体单层结果及先前聚合方法,为推进LLM的上下文价值对齐提供了稳健有效的机制。

这项研究为处理复杂伦理情境提供了新思路,通过动态融合机制使AI系统能更细腻地理解和回应多元价值诉求,对构建可信、适应性强的人工智能系统具有重要参考价值。

大语言模型价值对齐多智能体系统伦理AI模型融合

原文来源:https://arxiv.org/abs/2608.07642

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回