AgentOdyssey:为测试时持续学习智能体打造的开放式长程文本游戏生成框架
传统机器学习通常假设模型在测试阶段不再学习,但现实世界中的智能体需要能够在部署过程中持续与环境交互并进化。为系统评估这种“测试时持续学习”能力,研究团队开发了AgentOdyssey框架。该框架的核心创新在于能够程序化生成无限变化的开放式文本游戏,这些游戏包含复杂的实体关系、动态的世界规则以及需要长期规划才能完成的任务链。
AgentOdyssey突破了传统评估的局限,创造了一个学习与推理交织的连续、长程环境。研究者不仅关注游戏进度,还设计了一套多维诊断指标,涵盖世界知识获取、情景记忆、对象与动作探索、行动多样性以及模型成本等方面。通过对多种智能体范式的测试,研究发现:尽管基础模型越强性能越好,但即使最优智能体也远未达到人类水平,显示仍有巨大提升空间。值得注意的是,短期记忆机制对多种智能体范式均有助益,是智能体测试时训练的重要组成部分。这些发现为未来开发更适应开放世界的持续学习智能体指明了方向。