AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
预测效度
1 篇相关内容
相关话题
LLM智能体
AI评估
基准测试
arXiv
超越静态排行榜:如何更准地评估LLM智能体?
研究发现传统AI智能体排行榜的排名在真实部署场景中不稳定,提出用“预测效度”替代平均分来评估智能体,并设计了一套12层评估框架。
a
arXiv
·
31 天前
LLM智能体
AI评估
预测效度
基准测试
a