新指标登场:如何科学衡量大模型工具调用效率?
在大型语言模型(LLM)智能体日益依赖外部工具完成复杂任务的背景下,如何科学评估其工具调用效率成为关键问题。arXiv最新研究提出两项创新量化指标:“工具效率”用于衡量智能体执行轨迹中有用工具调用的比例;“边际工具效用”则针对每个具体工具调用,判断该工具是否必要——若能移除而不影响任务准确率,则视为可优化项。
研究团队采用“LLM即裁判”方法,对智能体执行轨迹中的每个工具调用进行边际效用正负判定。与以往通过准确率间接评估效率的研究不同,这项工作直接通过量化指标在事后轨迹分析中测量效率,为工具套件精简优化提供数据支撑。
论文指出,当前多数研究聚焦于提升LLM工具使用能力或通过准确率代理指标间接评估效率,而本研究提出的直接测量方法有望推动评估体系革新。未来可基于此设计新型基准测试,并在智能体工程实践中构建更精简的工具套件——优化那些与准确率互补但维度不同的效率指标。这项工作为LLM评估研究开辟了新方向,特别是在平衡性能与效率的智能体系统设计方面具有重要参考价值。