AI数学推理新发现:精准的评审未必能提升解题成功率
在数学与科学导向的AI系统中,常采用包含专门评审角色的分层设计,传统观点认为评审阶段应能将错误答案转化为正确解。然而,一项基于4,181个验证问题的研究对此提出了挑战。研究使用匹配的GPT-OSS-120B模型进行实验,发现在简单问题上协作增益有限,但从第4级难度开始,增益显著增加。有趣的是,在困难问题上,广播式同行讨论的最终准确率反而高于规划-执行-评审(PER)流程。进一步分析显示,PER评审的精准度虽更高(0.861 vs 0.644),但其提出的有效建议被采纳并改变后续答案的可能性更低,导致评审引导的修正效果较差。研究表明,评审检测质量与建议采纳度在实际中是可分离的。在PER流程中,强制要求显式确认反而降低了最终准确率,而将评审指导直接嵌入求解器工作环境能部分改善执行效果,但仍未完全弥合差距。这些发现提示,以评审为中心的系统评估可能高估实际性能:一个协议即使能很好地发现错误,若不能有效采纳这些批评,仍无法解决更多问题。