新指标登场:如何科学衡量大模型工具调用效率?

arXiv·4 天前

在大型语言模型(LLM)智能体日益依赖外部工具完成复杂任务的背景下,如何科学评估其工具调用效率成为关键问题。arXiv最新研究提出两项创新量化指标:“工具效率”用于衡量智能体执行轨迹中有用工具调用的比例;“边际工具效用”则针对每个具体工具调用,判断该工具是否必要——若能移除而不影响任务准确率,则视为可优化项。

研究团队采用“LLM即裁判”方法,对智能体执行轨迹中的每个工具调用进行边际效用正负判定。与以往通过准确率间接评估效率的研究不同,这项工作直接通过量化指标在事后轨迹分析中测量效率,为工具套件精简优化提供数据支撑。

论文指出,当前多数研究聚焦于提升LLM工具使用能力或通过准确率代理指标间接评估效率,而本研究提出的直接测量方法有望推动评估体系革新。未来可基于此设计新型基准测试,并在智能体工程实践中构建更精简的工具套件——优化那些与准确率互补但维度不同的效率指标。这项工作为LLM评估研究开辟了新方向,特别是在平衡性能与效率的智能体系统设计方面具有重要参考价值。

大语言模型工具调用评估指标智能体AI效率

原文来源:https://arxiv.org/abs/2607.14108

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回