AI代理“工具进化”真的有效吗?新研究质疑现有评估方法

arXiv·6 天前

近日,arXiv上发布的一项研究对当前大语言模型代理的自动工具进化评估方法提出了根本性质疑。研究者指出,现有工具进化方法通常使用单元测试用例来搜索最佳工具配置,然后在相同的公开基准上报告最终性能。这种评估协议存在两个核心问题:

首先,工具进化本身是一个迭代搜索过程,会反复使用任务反馈来评估和修订候选工具。就像代理测试时扩展一样,应该在匹配的反馈和推理预算下,与简单的任务级搜索基线进行比较,以确定其收益是来自改进的工具设计,还是仅仅来自额外的搜索。

其次,由于搜索和最终评估共享相同的基准,报告的性能提升可能过度拟合到特定任务集,缺乏泛化能力。

为解决这些问题,研究团队进行了广泛评估,在可比较的反馈和推理预算下,将工具进化与简单的测试时扩展和发现基线进行比较,并在保留任务上评估进化后的工具以检验其泛化能力。在Terminal-Bench 2.1基准上使用GPT-5.4和Claude Opus 4.6的实验表明,自动工具进化并未持续优于简单的测试时扩展方法,且表现出有限的泛化能力。

这些结果对自动工具进化的有效性提出了重要疑问,并强调了需要更公平的评估协议和基准。研究代码已在GitHub开源。

大语言模型AI代理评估方法工具进化基准测试

原文来源:https://arxiv.org/abs/2607.12227

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回