掩码扩散语言模型:基于文本的世界模型在智能体强化学习中的突破

arXiv·10 小时前

随着强化学习的发展,传统固定任务环境已难以满足模型训练需求。稀疏奖励和长时程任务容易导致模式崩溃,而世界模型通过模拟环境状态展现出替代实际环境交互的潜力。然而,自回归世界模型存在从左到右的生成偏见,难以处理全局相互依赖的状态锚点(如工具模式、历史轮次和预期结果)。

本研究首次将基于文本的世界建模形式化为可操控的转移动力学问题,分解为初始状态、任务上下文、工具模式、领域规则和操控指令五个维度。团队收集了涵盖9个开源环境和12个前沿模型家族的23.9万条具身状态-动作轨迹进行系统分析。

实验发现,掩码扩散语言模型通过双向锚点感知去噪机制,在连贯性、具身性和经验验证的轨迹多样性方面显著优于参数量4倍于自身的语言模型,同时保持相当的推理延迟。研究提出的即插即用GRPO训练框架结合确定性状态检查,在三个分布外环境(ScienceWorld、ALFWorld、AppWorld)和三种1.2B-7B智能体骨干网络(LFM2.5、Qwen3、Mistral)上实现零样本迁移,相比基线获得最高47%的绝对性能提升,且无需环境特定微调。

研究还进行了对抗场景下的失败模式行为分析,以及真实性、结果正确性和训练效用的人类评估。团队已开源相关资源,以推动该方向的研究进展。

强化学习世界模型扩散模型智能体文本生成

原文来源:https://arxiv.org/abs/2607.16204

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回