AI社交盲区:NormAct揭示大模型在具身规划中难以察觉隐藏社会规范

arXiv·22 天前

当AI助手走进现实场景,它们不仅要完成任务指令,还需像人类一样遵守未言明的社交规则。arXiv最新研究《NormAct: A Benchmark for Hidden Social Norm Compliance in Embodied Planning》揭示了一个关键短板:当前最先进的多模态大语言模型(如GPT-4、Claude Opus、Gemini Pro)在具身规划任务中,对隐藏社会规范的识别能力严重不足。

研究团队设计了一套独特的评估体系,将社交规范巧妙嵌入日常任务场景(如整理房间、公共场所行为等),要求AI在未获明确提示的情况下自主推断并遵守这些“潜规则”。实验结果令人惊讶:模型在67.3%的情况下能达成显性目标,但仅有26.4%的案例符合隐藏的社会规范。这表明模型并非缺乏社交常识,而是在具体场景中难以激活并落地这些知识。

为突破这一瓶颈,研究者提出了NormPerceptor解决方案——一个上下文感知的提示生成器,可在规划前推断场景相关规范。该方法将任务整体成功率从24.2%提升至46.7%,证明通过前置的规范感知机制能显著改善AI的社会适应性。这项研究强调,未来具身智能体必须学会主动探测隐性规范、将其锚定于视觉证据,并转化为行动规划的约束条件。完整基准数据集已开源,为AI社会智能研究提供了重要工具。

具身智能多模态大模型社会规范基准测试AI伦理

原文来源:https://arxiv.org/abs/2606.27826

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回