AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
研究方法
1 篇相关内容
相关话题
智能体评测
基准测试
LLM评估
arXiv
智能体评测需要多少任务才够?公开LLM智能体基准测试的回放分析
研究通过回放SWE-bench、AppWorld等公开基准测试数据,发现部分任务运行往往无法得出与完整测试相同的结论,不同基准所需任务比例差异显著。
a
arXiv
·
6 天前
智能体评测
基准测试
LLM评估
研究方法
a