新框架VirtueMap:用亚里士多德美德伦理透视大语言模型的道德倾向

arXiv·21 天前

大语言模型在面对伦理困境时,常需在多种合理但价值倾向不同的回应间做出选择。arXiv最新研究提出VirtueMap评估框架,创新性地引入亚里士多德美德伦理学视角,系统分析模型的伦理价值取向。

该研究设计了七类通用伦理困境场景,每个场景提供五种可能回应,要求人类或模型对这些回应进行排序。研究团队首先为每个困境和美德定义了从“最体现”到“最不体现”该美德的参考排序,并通过超过100位受访者的验证——仅当95%以上确认时才保留作为评分基准。

采用标准化博尔达对齐算法,VirtueMap从实践智慧、正义、诚实、勇气、节制五个维度生成模型的美德画像。在对九个主流大语言模型家族的重复运行评估中,模型展现出高达90.3%的平均排序一致性,但在勇气、节制和正义维度上差异最为显著。

研究者同步发布了交互式网站,支持在本地浏览器中计算美德画像,并允许用户将自己的伦理倾向与已测模型进行对比。该方法为理解AI系统的伦理决策模式提供了结构化工具,有助于推动更具价值对齐性的模型开发。

伦理评估大语言模型美德伦理学AI对齐可解释AI

原文来源:https://arxiv.org/abs/2606.28683

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回