AGI Maze:世界建模智能体新基准,LLM 推理能力面临挑战

arXiv·19 天前

大语言模型(LLM)是强大的模式补全系统,但其默认的静态上下文预测模式难以生成持久、可操作的外部世界表示。当环境变为部分可观测、有状态且需要记忆和结构化假设时,许多文本中的“推理”任务会显著变难。为此,研究团队在 arXiv 上发布了 AGI Maze——一个轻量级框架,用于构建无需高维感官输入的此类环境。该框架提供了一系列基于网格的迷宫任务,具有清晰的 API 和多种难度模式,旨在创建智能体必须学习并使用世界状态表示的基准,而不仅仅是基于现成观察推断局部规则。

初步评估显示,多个原始 LLM 在简单迷宫任务上失败,无法在推理时内部表示迷宫结构。研究还引入了一个基线智能体,允许其使用消息历史作为工作记忆,在运行时构建观察描述。虽然这提升了部分性能,但 LLM 智能体仍无法在足够人类完成的步数预算内可靠解决小型迷宫。AGI Maze 为测试智能体的世界建模与长期推理能力提供了标准化平台,突显了当前 LLM 在动态环境中的局限性。

基准测试世界建模大语言模型推理能力部分可观测环境

原文来源:https://arxiv.org/abs/2607.00627

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回