超越“下一步预测”:面向决策的智能体自主世界建模新方法
当前基于大语言模型(LLM)的智能体世界建模研究,普遍将训练目标设定为‘下一观测值预测’。然而,这种范式存在根本性局限:环境反馈的随机性可能掩盖对当前决策最关键的环境动态信息。为突破这一限制,研究团队提出‘智能体自主世界建模’(AAWM)训练框架。
AAWM的核心创新在于,让智能体在每个决策状态主动识别‘我需要理解环境的哪些方面’,并以此驱动跨轨迹的相关转移证据检索。这些证据被合成为面向决策的动态训练目标,而非简单重建下一个观测值。这使训练目标与策略执行前所需理解的环境动态对齐,而非与下一个观测内容绑定。
实验在多个环境和训练设置中验证了AAWM的有效性。结果表明,这种决策感知的世界建模目标能提供比传统下一观测预测更高效的学习信号。该研究为构建更自主、更适应复杂决策场景的AI智能体提供了新的理论框架与方法路径,尤其对需要长期规划与动态环境理解的AI应用具有重要启示。