AI代理前瞻记忆大挑战:PM-Bench基准揭示LLM执行延迟意图的困境

arXiv·6 天前

在AI代理领域,前瞻记忆能力——即在特定未来线索或状态下执行意图,同时处理其他任务的能力——正成为关键挑战。近日,研究团队在arXiv发布了PM-Bench基准测试,专门用于评估现代大语言模型代理的前瞻记忆表现。

该基准测试灵感来自认知科学中的“虚拟星期”范式,模拟了为期七天的活动场景。在测试中,AI代理需要在进行日常活动的同时,监控环境变化,并在适当时机执行用户预先设定的延迟意图。这要求代理具备持续监控、意图保持和时机判断的综合能力。

研究团队对八种最先进的大语言模型进行了全面测试,涵盖了八种不同的代理配置。结果显示,所有模型在PM-Bench上都面临显著困难:表现最佳的GPT-5.4代理仅获得65.1%的F1分数。更值得注意的是,没有单一的策略能够在所有模型上持续提升前瞻记忆表现,不同模型需要针对性的优化方案。

PM-Bench的发布为诊断AI代理的前瞻记忆缺陷提供了标准化测试平台。研究人员希望这一基准能够推动训练方法和推理时干预技术的发展,最终帮助AI代理实现更可靠的前瞻行为。该测试套件已公开,供社区进一步研究和改进。

大语言模型AI代理基准测试认知科学arXiv

原文来源:https://arxiv.org/abs/2607.12385

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回