AGI Maze:世界建模智能体新基准,LLM 推理能力面临挑战
大语言模型(LLM)是强大的模式补全系统,但其默认的静态上下文预测模式难以生成持久、可操作的外部世界表示。当环境变为部分可观测、有状态且需要记忆和结构化假设时,许多文本中的“推理”任务会显著变难。为此,研究团队在 arXiv 上发布了 AGI Maze——一个轻量级框架,用于构建无需高维感官输入的此类环境。该框架提供了一系列基于网格的迷宫任务,具有清晰的 API 和多种难度模式,旨在创建智能体必须学习并使用世界状态表示的基准,而不仅仅是基于现成观察推断局部规则。
初步评估显示,多个原始 LLM 在简单迷宫任务上失败,无法在推理时内部表示迷宫结构。研究还引入了一个基线智能体,允许其使用消息历史作为工作记忆,在运行时构建观察描述。虽然这提升了部分性能,但 LLM 智能体仍无法在足够人类完成的步数预算内可靠解决小型迷宫。AGI Maze 为测试智能体的世界建模与长期推理能力提供了标准化平台,突显了当前 LLM 在动态环境中的局限性。