大语言模型工具切换能力测试:当可靠工具暗中改变时
当大语言模型智能体在持续会话中使用的可靠工具悄然发生变化时,它们会如何调整工具选择?一项最新研究借用认知心理学中的“集合转换”概念,系统评估了智能体应对隐藏可靠性变化的适应能力。
研究团队构建了一个包含冗余工具的基准测试环境:多个工具可完成相同任务,但隐藏的可靠性各不相同。在评估框架中,可靠工具组会在隐藏边界处发生切换,每次切换都配有未切换的对照组。研究发现,智能体默认会在每个边界后的几次交互中固守少量重复使用的工具,调用份额在每次可靠性变化后集中在几个离散值上。
研究人员为每个智能体轨迹设定了集合转换准确度评分:在每个切换后窗口中选择目标工具组的联合概率。通过在开源智能体框架中测试开源权重LLM,发现相同工具使用模式下存在性质不同的失败类型。
值得注意的是,工具集的呈现方式——将备选工具展示为竞争关系还是互补关系——会显著改变智能体的路由动态。这项研究为评估智能体在动态环境中的适应能力提供了新视角,对实际部署中的工具切换策略设计具有参考价值。