AI编程代理新挑战:验证比生成更难,没有“银弹”奖励函数
传统观点认为验证解决方案比生成方案更容易。然而,对于当今的AI编程代理而言,这一直觉正在被颠覆:随着基础模型推理能力日益增强,工程工具链日趋成熟,生成复杂的候选解决方案已不再困难——可靠地验证它们反而成了更棘手的问题。
任何我们构建的验证器都只是人类意图的代理,而非意图本身。这导致验证面临双重困难:首先,意图本质上是未充分定义的,因此很难忠实检查其是否被满足;其次,在模型训练过程中,优化会拉大代理与意图之间的差距——表现为奖励破解或信号饱和。
为解决此问题,研究从三个维度刻画验证信号的质量:可扩展性、忠实性和鲁棒性,并指出同时实现三者是核心挑战。研究进一步分析了四种奖励构建方式:通用编码任务的测试验证器、前端任务的规则验证器、真实世界代理任务的用户验证,以及长周期任务的自动化代理验证器。
通过在不同任务类型和策略能力水平上进行深入分析和实验,研究表明:针对性的验证设计能有效抑制奖励破解,提高任务完成质量,并在多个内部和公共基准测试中取得显著提升。这些经验共同指向一个核心观察:随着策略能力持续增长,没有固定的奖励函数能始终保持有效;验证必须与生成器协同进化。