新框架VirtueMap:用亚里士多德美德伦理透视大语言模型的道德倾向
大语言模型在面对伦理困境时,常需在多种合理但价值倾向不同的回应间做出选择。arXiv最新研究提出VirtueMap评估框架,创新性地引入亚里士多德美德伦理学视角,系统分析模型的伦理价值取向。
该研究设计了七类通用伦理困境场景,每个场景提供五种可能回应,要求人类或模型对这些回应进行排序。研究团队首先为每个困境和美德定义了从“最体现”到“最不体现”该美德的参考排序,并通过超过100位受访者的验证——仅当95%以上确认时才保留作为评分基准。
采用标准化博尔达对齐算法,VirtueMap从实践智慧、正义、诚实、勇气、节制五个维度生成模型的美德画像。在对九个主流大语言模型家族的重复运行评估中,模型展现出高达90.3%的平均排序一致性,但在勇气、节制和正义维度上差异最为显著。
研究者同步发布了交互式网站,支持在本地浏览器中计算美德画像,并允许用户将自己的伦理倾向与已测模型进行对比。该方法为理解AI系统的伦理决策模式提供了结构化工具,有助于推动更具价值对齐性的模型开发。