代码智能体如何攻克ARC-AGI难题?关键组件效能深度解析

arXiv·1 天前

在人工智能编程领域,如何构建能解决抽象推理任务(如ARC-AGI)的代码生成智能体一直是研究热点。先前研究中集成了可执行世界建模、计划简化和精确回放验证三大组件的智能体表现出色,但各组件具体贡献尚不明确。

最新研究通过设计四层嵌套的Codex基智能体架构对此进行了系统性解构:基础文本版本、无验证的可执行世界模型版、增加计划简化的版本,以及保留简化并强制要求精确复现观察记录的固定接口验证版。研究团队使用gpt-5.4和gpt-5.5模型在不同推理强度下对公开ARC-AGI-3游戏集进行了全面评估。

实验揭示了几项关键发现:所有智能体变体都随着模型能力增强和推理资源增加而提升性能;在相同模型-资源配置下,各变体间差异小于预期,而单个组件的效果因设置而异。值得注意的是,强制要求持久可执行交付物并非总是有利——在gpt-5.5的两个设置中,纯文本版本反而优于灵活接口的可执行版本。计划简化在四分之三的设置中提升了性能,仅在最弱配置下例外。完整的验证方案在所有四个设置中均排名第一,但其资源消耗显著更高。

在后续的gpt-5.6-sol探索性实验中,验证变体在两个推理强度下完全解决了所有公开游戏,达到约99%的相对人类表现效率,且总操作数不到人类基线的一半。由于该模型在这些游戏发布后才出现,且对未公开数据的表现尚未测试,此结果应谨慎解读为仅代表对公开数据集的饱和性能。

代码生成智能体ARC-AGI可执行世界建模程序验证抽象推理

原文来源:https://arxiv.org/abs/2607.15439

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回