行为科学AI评测基准BehaviorBench发布,揭示大模型在行为预测中的能力差异

arXiv·27 天前

随着大模型在心理学、社会学和经济学等行为科学领域的应用日益增多,学界亟需一个系统性评估其在多样化任务、情境和人群表现的标准。近日,研究人员在arXiv上发布了BehaviorBench基准,该基准从四个核心能力维度对大模型进行评估:行为预测与模拟、战略决策、主体特质推断以及行为知识应用。

BehaviorBench的创新之处在于同时评估模型在个体层面和分布层面的输出结果,不仅关注单主体预测准确率,更重视群体层面的分布对齐度——这是行为科学有效性的关键要求。基于该基准,研究团队进一步开发了Be.FM-1.5模型,这是Be.FM系列行为基础模型的扩展版本,专门在行为数据上进行了微调。

评测结果显示了一个显著差距:商业通用大模型在个体层面预测和知识密集型任务上表现优异,而基于行为数据微调的行为基础模型则在分布对齐度方面优势明显。值得注意的是,Be.FM-1.5在分布指标上领先,同时在个体层面指标上保持竞争力,这表明适当的行为适应能够弥合这一差距。

这项研究强调了分布评估的重要性,确立了BehaviorBench作为开发和评估行为对齐AI系统的基础平台,并展示了Be.FM-1.5在广泛行为科学研究中的潜力。相关资源和模型已通过项目网站开源。

行为科学大模型评测AI基准行为预测分布对齐

原文来源:https://arxiv.org/abs/2606.24162

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回