智能体评测需要多少任务才够?公开LLM智能体基准测试的回放分析
在大型语言模型智能体的评估中,基准测试通常需要运行全部任务后才能比较两个智能体的性能。但由于评估成本高昂,研究人员常倾向于只运行部分任务。然而,仅凭任务完成比例并不能说明部分运行能否支持与完整基准测试相同的对比结论。
一项最新研究通过回放SWE-bench、AppWorld和tau-bench三个公开基准测试的任务级记录,深入探讨了这一问题。研究发现,只有当部分预算运行能够支持完整基准测试的决策、覆盖所需任务组,并且未解决的对比不超过目标比例时,才能认为部分运行足够可靠。
研究结果显示,不同基准测试所需的任务比例差异显著。在5个百分点预算网格的严格0个百分点阈值下,AppWorld首次在15%任务比例时满足所有目标,tau-bench需要25%,而SWE-bench Verified需要高达90%;SWE-bench Lite在主要覆盖规则下即使达到95%任务比例仍无法满足所有目标。
基于这些发现,研究建议部分评估报告应明确说明:一个智能体需要超越另一个多少性能、任务如何选择、需要何种覆盖规则、使用什么决策规则,以及允许多少对比结果保持未解决状态。这些透明度要求将有助于提高智能体评估的可信度和可比性。