多智能体融合新框架:让大模型更懂人类价值观的多样性
大语言模型如何与多元人类价值观对齐仍是AI可信化的重要挑战。现有方法如RLHF、CAI等多采用单智能体框架和统一奖励机制,难以捕捉伦理多元性、适应不同道德情境,也无法反映多智能体道德推理的动态特性。
近日,研究人员在arXiv发表新论文,提出多层组合融合上下文价值对齐框架MCF-CVA。该框架在第一层实例化多个道德智能体,每个智能体微调后代表特定价值观。随后通过分数组合与排名组合、平均与加权聚合等方式对输出进行组合扩展,再将组合模型缩减至初始道德智能体数量。这种扩展-缩减过程在多层中迭代,直至满足停止条件。
MCF-CVA框架利用智能体间的认知多样性,缓解多智能体间的冲突与冗余,生成更贴合上下文人类价值观的回应。框架基于欧几里得分数空间和Kemeny排名空间的双重架构运行EAR算法。实证评估表明,该框架在标准指标上优于单智能体基线、多智能体单层结果及先前聚合方法,为推进LLM的上下文价值对齐提供了稳健有效的机制。
这项研究为处理复杂伦理情境提供了新思路,通过动态融合机制使AI系统能更细腻地理解和回应多元价值诉求,对构建可信、适应性强的人工智能系统具有重要参考价值。