大语言模型工具切换能力测试:当可靠工具暗中改变时

arXiv·5 天前

当大语言模型智能体在持续会话中使用的可靠工具悄然发生变化时,它们会如何调整工具选择?一项最新研究借用认知心理学中的“集合转换”概念,系统评估了智能体应对隐藏可靠性变化的适应能力。

研究团队构建了一个包含冗余工具的基准测试环境:多个工具可完成相同任务,但隐藏的可靠性各不相同。在评估框架中,可靠工具组会在隐藏边界处发生切换,每次切换都配有未切换的对照组。研究发现,智能体默认会在每个边界后的几次交互中固守少量重复使用的工具,调用份额在每次可靠性变化后集中在几个离散值上。

研究人员为每个智能体轨迹设定了集合转换准确度评分:在每个切换后窗口中选择目标工具组的联合概率。通过在开源智能体框架中测试开源权重LLM,发现相同工具使用模式下存在性质不同的失败类型。

值得注意的是,工具集的呈现方式——将备选工具展示为竞争关系还是互补关系——会显著改变智能体的路由动态。这项研究为评估智能体在动态环境中的适应能力提供了新视角,对实际部署中的工具切换策略设计具有参考价值。

大语言模型智能体工具使用认知心理学可靠性测试

原文来源:https://arxiv.org/abs/2607.13396

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回