验证粒度自适应:GRACE框架为测试时扩展找到最优计算效率
测试时扩展(TTS)已成为提升大语言模型推理能力的重要范式,其核心在于通过验证器对候选解进行筛选评分。现有研究多关注验证本身的价值,却忽视了一个关键问题:在给定计算预算下,何种验证粒度能达到最优效率?粗粒度的结果奖励模型与细粒度的过程奖励模型各有利弊,但都无法在所有场景下实现计算最优。
近日,研究者提出统一理论框架GRACE(粒度调节自适应计算效率),首次将验证粒度最优解表达为问题难度、验证器精度和计算预算的显式函数。理论证明存在相变现象:当计算预算充足或问题困难时,细粒度验证占优;而在预算有限、问题简单时,粗粒度验证更有效。该框架将Best-of-N、束搜索和步骤级蒙特卡洛树搜索统一于帕累托最优体系,并推导出自适应粒度策略,可理论保证达到计算-性能的帕累托前沿。
在MATH-500、GSM8K和AIME三个数学推理基准上的实验验证了全部四项理论预测。自适应策略在同等计算量下比固定粒度基线最高提升3.1%的准确率,为实际部署中的计算资源分配提供了理论依据与实用方案。