验证粒度自适应:GRACE框架为测试时扩展找到最优计算效率

arXiv·31 天前

测试时扩展(TTS)已成为提升大语言模型推理能力的重要范式,其核心在于通过验证器对候选解进行筛选评分。现有研究多关注验证本身的价值,却忽视了一个关键问题:在给定计算预算下,何种验证粒度能达到最优效率?粗粒度的结果奖励模型与细粒度的过程奖励模型各有利弊,但都无法在所有场景下实现计算最优。

近日,研究者提出统一理论框架GRACE(粒度调节自适应计算效率),首次将验证粒度最优解表达为问题难度、验证器精度和计算预算的显式函数。理论证明存在相变现象:当计算预算充足或问题困难时,细粒度验证占优;而在预算有限、问题简单时,粗粒度验证更有效。该框架将Best-of-N、束搜索和步骤级蒙特卡洛树搜索统一于帕累托最优体系,并推导出自适应粒度策略,可理论保证达到计算-性能的帕累托前沿。

在MATH-500、GSM8K和AIME三个数学推理基准上的实验验证了全部四项理论预测。自适应策略在同等计算量下比固定粒度基线最高提升3.1%的准确率,为实际部署中的计算资源分配提供了理论依据与实用方案。

大语言模型推理优化计算效率测试时扩展验证机制

原文来源:https://arxiv.org/abs/2606.19354

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回