AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
部分可观测环境
1 篇相关内容
相关话题
基准测试
世界建模
大语言模型
推理能力
AGI Maze:世界建模智能体新基准,LLM 推理能力面临挑战
研究者提出 AGI Maze 基准框架,用于评估智能体在部分可观测环境中的世界建模能力,实验显示当前 LLM 难以在推理时内部表示迷宫状态,即使借助记忆机制仍无法可靠解决简单任务。
a
arXiv
·
19 天前
基准测试
世界建模
大语言模型
推理能力
a