研究揭示:多数大语言模型具有稳定风险态度

arXiv·10 小时前

随着人工智能系统在开放式、高风险场景中的部署,一个重要但尚未被充分测量的维度是:系统如何将感知到的风险转化为具体行动。一项最新研究通过跨领域框架,测试了大语言模型在不确定性下的风险态度是否具有系统性和一致性。

研究团队设计了一套能够分离情境风险信念与分类决策的评估框架,并将其应用于6个代表性大语言模型和100名人类参与者。测试涵盖空间导航、临床分诊和资金分配三类任务。通过回归模型,研究人员提取了每个智能体的信念-决策映射关系,并量化了风险敏感度和风险态度偏差。

研究发现,大多数测试的大语言模型表现出三个关键特征:首先,在单一任务领域内具有稳健的内部一致性,表明从情境信念到风险决策的映射关系稳定;其次,跨领域保持风险态度的相对排序稳定性;第三,与更广泛的人类基线相比,模型的风险态度分布范围更为集中。

这些结果表明,风险态度是大语言模型行为中一个稳定且此前未被充分描述的特征维度。该发现为评估和校准开放式决策中的AI系统奠定了基础,并推动了对这些内在行为倾向起源的进一步研究。研究论文已提交至arXiv预印本平台。

大语言模型风险态度决策评估AI对齐arXiv研究

原文来源:https://arxiv.org/abs/2607.16197

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回