长视野终端基准发布:AI智能体面临极限挑战

arXiv·8 天前

当前AI智能体已能自主完成简短明确的任务,但现有终端基准测试多聚焦于几分钟内解决的简单问题,仅通过最终结果评估性能。这种设置忽略了中间进展和部分解决方案,导致奖励信号稀疏且无法全面反映智能体能力。

研究团队近日推出Long-Horizon-Terminal-Bench长视野终端基准测试,包含46项跨9个类别的长流程任务,涵盖实验复现、软件工程、多模态分析、交互游戏和科学计算等领域。每项任务采用终端基准风格设置,配备参考解决方案或模拟引擎,并进一步分解为细粒度评分子任务。这种设计支持密集中间奖励和部分积分,使评估不仅能判断智能体是否达成最终目标,还能衡量其在开放式工作流程中的进展程度。

该基准测试中的任务通常需要数百个回合、数分钟至数小时执行时间,重点考察长视野规划、长上下文管理和迭代调试能力,而非一次性问题解决。团队评估了15个前沿模型,发现智能体平均每项任务消耗990万token,每轮运行约需231个回合和85.3分钟执行时间,使该基准比以往终端基准更具挑战性。

测试结果显示,即使在部分奖励阈值0.95条件下,最强测试模型仅实现15.2%的通过率;在完美奖励阈值1.0条件下通过率降至10.9%。所有模型在两个阈值下的平均通过率分别为4.3%和1.7%,表明现有智能体在长流程任务处理上仍有巨大改进空间。研究团队进一步分析了失败模式和错误类型,并开源该基准以推动长视野终端智能体的未来发展。

AI智能体基准测试长流程任务评估框架arXiv

原文来源:https://arxiv.org/abs/2607.08964

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回