LLM生成代码世界模型:验证准确不等于游戏制胜

arXiv·4 天前

大语言模型能够将游戏规则合成为可执行代码,形成代码世界模型,供传统规划器进行搜索。这类模型通常在其对采样轨迹的转换准确率达到高水平时被接受。然而,最新研究指出,对于规划任务而言,这种基于采样准确性的评估标准存在根本缺陷。

研究团队通过实验揭示了四个关键发现:首先,LLM合成的代码世界模型可以在采样测试中实现100%的转换准确率,并在规划器自身搜索分布上达到≥98%的状态准确率,但在实际游戏中却会系统性失败。这是因为模型遗漏的不足1%的错误恰恰涉及游戏的关键动态机制。实验中,遗漏规则导致的游戏成本为0.091(95%置信区间[0.065,0.117])。这种现象被称为“验证与正确之间的差距”。

其次,这种危害遵循定量规律:危险度=游戏成本×(1-罕见性)^N。其中,(1-罕见性)^N的“门漏因子”被证明是精确的,而游戏成本可通过实验界定。第三,增加数据并不能修复这一失败:LLM合成过程表现为规则翻译而非规则推断,即使在GPT-5.x等不同模型和数据机制(包括DAgger和针对性示例)下,模型也未能推断出被遗漏的规则。

最后,在不完美信息代码世界模型的信念推断函数中,相同机制再次出现。研究证明了一个覆盖边界(当N≳b^{d_max}时,大小为N的门具有识别能力),这解释了为何像库恩扑克这样的浅层游戏不会出现这种差距,并手工构建了Beacon——一个通过验证但在每场游戏中都会失败的推断函数。

这些结果表明,面向规划的世界模型的充分性应通过搜索分布或直接游戏表现来衡量,而非基于采样转换的预测准确性。

大语言模型代码世界模型游戏AI规划系统模型验证

原文来源:https://arxiv.org/abs/2607.14169

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回