验证器即课程:基于执行门控的自蒸馏技术实现跨家族游戏生成突破

arXiv·7 天前

在代码生成模型的后期训练中,针对学习型评判器的优化可能导致模型仅提升代理特征分数而未能改善实际生成质量。最新研究提出了一种反向思路:采用确定性的、无评判器的、不可被博弈的过滤机制——即检测生成项目能否在无头引擎中干净启动(严格启动)。在此门控条件下,拒绝采样的自蒸馏方法显著提升了模型在陌生任务领域的泛化能力。

在GameCraft-Bench基准测试中(该测试要求将自然语言描述转化为完整的Godot游戏项目),基于Qwen3-14B模型配合LoRA微调的技术方案,经过三轮严格启动门控的自蒸馏训练后,模型在四个未见游戏家族上的单候选生成成功率从8.8%跃升至42.2%,最佳候选覆盖率从18/25达到满分25/25(黄金上限)。统计分析显示每轮提升均具有统计显著性(p值分别为0.0019、<1e-4、<1e-4)。

研究通过对照实验排除了数据量增加的干扰:完全复制黄金数据的对照组性能反而低于基线模型(5.6% vs. 8.8%),而分解实验表明首轮至次轮的提升可归因于质量改善(+8.8个百分点)与数据量增加(+8.5个百分点)的双重作用。最关键的是,当仅将过滤机制替换为通过率99.9%的宽松构建检查时,所有增益完全消失,证明核心驱动力在于验证器的精确性而非优化过程本身。

该研究同时验证了第二种不可博弈信号——无头执行基础——在训练轮次中持续提升,在相同预算下比黄金数据复制产生更多基础稳固的候选方案(16 vs. 5),确认了所获增益的功能性实质。游戏生成领域为这一核心洞见提供了可验证的试验场:验证器即课程——模型所学正是验证器所认证的内容。

自蒸馏代码生成游戏生成模型训练泛化能力

原文来源:https://arxiv.org/abs/2607.09709

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回