推理模型何时需要“学会停止”?成本感知下的早退机制研究

arXiv·20 天前

在大型语言模型的推理过程中,不同问题所需的计算量差异显著,但如何确定最佳停止时机一直是实践难题。arXiv最新研究提出LearnStop——一种无需隐藏状态的检查点停止器,通过分析当前推理前缀生成简短答案,并利用在线特征(如答案置信度、熵值、投票比例、稳定性等)预测前缀正确性。研究团队在GSM8K、MATH-500、MMLU-Pro等18个任务模型组合中进行了系统性测试,发现停止策略的有效性高度依赖任务类型。在自由格式数学任务中,学习型多特征停止机制能提升固定计算预算下的性能边界:以Qwen3-32B在GSM8K任务为例,经验边界实现了+0.157的后验自适应增益,验证集选定的操作点保持正向增益,相较于最强标量基线的配对增益达+0.028。然而在选择题和超高难度场景中,传统的标量置信度、熵值或稳定性规则仍具竞争力甚至更优。研究团队强调,学习型停止不应被视为标量退出机制的通用替代方案,而是其价值取决于推理轨迹结构的工具。该研究还提供了验证集操作点选择、配对自助检验、有限网格风险校准等完整评估框架,并对比了KV缓存分叉、前缀缓存等不同推理成本模式下的表现。核心实践发现表明:当大量问题在预算耗尽前已获正确解,但缺乏单一可靠停止信号时,学习型停止机制价值显著;而当置信度或答案收敛已能解决停止问题时,其优势基本消失。

推理优化早退机制计算效率模型部署成本控制

原文来源:https://arxiv.org/abs/2606.30852

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回