OPINE-World:通过本体错误优先探索构建程序化世界模型
近日,一项名为 OPINE-World 的研究在 arXiv 上发布,旨在解决智能体在陌生环境中高效学习世界模型的问题。传统基于深度网络的世界模型虽灵活但数据需求大、泛化能力有限;而基于程序合成的模型虽数据效率高、可复用,却难以适应像素级渲染的复杂环境。OPINE-World 创新性地结合了假设与测试的双智能体协作机制:一个智能体在环境中交互探索,另一个则通过代码合成模型,并利用回放验证和基于模型的规划进行优化。其核心在于引入“本体错误”这一贝叶斯度量,以优先探索对象类型的合理性,从而引导学习过程。实验在 ARC-AGI-3 基准上进行,该基准隐藏了对象词汇、目标和动作语义,以评估技能获取效率。结果显示,OPINE-World 在无需每游戏训练的情况下,成功解决了 25 个游戏中的 20 个,动作效率得分达到 78.4(以人类基线为参照),展现了其在未知任务中的强大适应性和数据效率。