OPINE-World:通过本体错误优先探索构建程序化世界模型

arXiv·18 天前

近日,一项名为 OPINE-World 的研究在 arXiv 上发布,旨在解决智能体在陌生环境中高效学习世界模型的问题。传统基于深度网络的世界模型虽灵活但数据需求大、泛化能力有限;而基于程序合成的模型虽数据效率高、可复用,却难以适应像素级渲染的复杂环境。OPINE-World 创新性地结合了假设与测试的双智能体协作机制:一个智能体在环境中交互探索,另一个则通过代码合成模型,并利用回放验证和基于模型的规划进行优化。其核心在于引入“本体错误”这一贝叶斯度量,以优先探索对象类型的合理性,从而引导学习过程。实验在 ARC-AGI-3 基准上进行,该基准隐藏了对象词汇、目标和动作语义,以评估技能获取效率。结果显示,OPINE-World 在无需每游戏训练的情况下,成功解决了 25 个游戏中的 20 个,动作效率得分达到 78.4(以人类基线为参照),展现了其在未知任务中的强大适应性和数据效率。

世界模型程序合成强化学习LLM 智能体ARC-AGI

原文来源:https://arxiv.org/abs/2607.01531

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回