LLM智能体如何主动寻求澄清?新研究提出不确定性分解方法

arXiv·31 天前

近期有观点认为,传统的不确定性分类框架不足以应对交互式大语言模型智能体的需求,需要能够支持主动澄清和共享心智模型构建的新型不确定性表示方法。然而,实际部署中的约束条件——如黑盒API、交互延迟限制以及缺乏标注轨迹——排除了基于对数概率、多重采样和训练的方法,使得基于提示的估计成为最可行的方案。

针对这一需求,研究团队提出了一种简单的基于提示的分解方法,将行动信心与请求不确定性分离开来,使智能体能够在任务描述模糊时主动寻求澄清。为了评估该方法,研究人员引入了两个增强版基准测试(WebShop-Clarification和ALFWorld-Clarification),其中50%的任务被故意设计为描述不完整。

在实验中,该方法与ReAct+UE和不确定性感知记忆(UAM)进行了系统比较,测试覆盖了五个大语言模型骨干(包括GPT-5.1、DeepSeek-v3.2-exp、GLM-4.7等)。结果显示,平均而言,该方法在ALFWorld-Clarification上的澄清F1分数比ReAct+UE提高了73%,比UAM提高了36%。在WebShop-Clarification上,所有骨干模型都取得了更好的澄清效果;在ALFWorld-Clarification上,五个骨干模型中有四个表现更优,表明该方法具有良好的泛化能力。

这项研究为大语言模型智能体在真实场景中处理模糊任务提供了实用工具,有助于提升人机协作的效率和可靠性。

大语言模型智能体不确定性人机交互基准测试

原文来源:https://arxiv.org/abs/2606.19559

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回