AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
长流程任务
1 篇相关内容
相关话题
AI智能体
基准测试
评估框架
arXiv
长视野终端基准发布:AI智能体面临极限挑战
研究者推出长视野终端基准测试,包含46项需数小时完成的任务,旨在评估AI智能体在复杂长流程任务中的表现。测试显示当前最强模型仅达15.2%通过率,揭示巨大提升空间。
a
arXiv
·
8 天前
AI智能体
基准测试
长流程任务
评估框架
a