ToolAnchor:用反事实锚点打破AI工具使用惯性,提升智能体适应新工具能力

arXiv·4 天前

当前,基于工具增强的大语言模型智能体在长周期任务中表现出色,但其通常是在固定工具集上进行后训练的。当任务需要新工具时,这些智能体往往难以有效整合,而从头开始重新训练通常不切实际。研究团队将这种工具集扩展问题的核心障碍归结为‘行为惯性’:即智能体倾向于依赖熟悉的工具和既有的推理模式,即使新工具可用。

为解决这一问题,研究提出在关键决策点注入‘反事实锚点上下文’可以打破这种惯性。这些锚点能够恢复失败的执行轨迹,通过激发智能体被抑制的能力来改善其表现。基于此洞察,团队开发了ToolAnchor框架。该框架利用教师模型来假设这些反事实上下文,通过学生模型的推演进行验证,并借助智能体后训练将成功的干预内化。

在通用AI助手(GAIA)、文本搜索(BrowseComp)和视觉搜索(VDR-Bench)等任务上的广泛评估表明,ToolAnchor在扩展工具集下 consistently 展现出有竞争力的性能。这项工作弥合了静态后训练与动态适应之间的差距,为可扩展的智能体强化学习开辟了新路径。该研究为解决AI智能体工具使用的灵活性问题提供了新思路,有望推动更自适应、更通用的AI助手发展。

大语言模型智能体工具使用强化学习模型适应

原文来源:https://arxiv.org/abs/2607.14145

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回