大模型“想太多”怎么办?新方法DASH让AI学会适时停止思考
最新研究发现,推理型语言模型普遍存在“过度思考”问题:模型会生成冗长的推理链,包括犹豫不决、放弃原有思路、自我矛盾等行为,这些行为消耗了大量计算资源却未能改善最终答案质量。值得注意的是,这种低效现象并非单纯由回答长度导致——即使在控制回答长度的情况下,错误推理轨迹中的无效自我反思比例也显著高于正确轨迹。
传统解决方案需要为每个推理步骤标注监督信号,成本高昂。研究团队创新性地发现,推理过程中的中间答案承诺可以作为廉价替代指标:通过将推理轨迹中的每个候选最终答案与真实答案比较,无需额外标注就能判断后续反思是否有效。基于这一洞察,团队提出了DASH方法(漂移感知优势塑形),该方法根据每个推理片段是导向正确还是偏离正确方向来分配片段级信用值。
在AIME25等数学竞赛基准测试中,DASH在过度思考现象突出的场景下取得了最佳表现(准确率50.8%,对比基线GRPO的45.4%),同时显著减少了过度思考行为,实现了更高效的自我修正。这项研究为提升大模型推理效率提供了新思路,有望降低计算成本并改善用户体验。