新算法C3RL:让大语言模型学会“诚实”表达自信度
当前大语言模型通过强化学习训练后,性能虽有提升,却常出现“过度自信”的问题——在不确定时仍给出高置信度的错误答案。arXiv最新研究《Scaling with Confidence》针对此缺陷,提出了C3RL(正确性与置信度校准强化学习)算法。
C3RL创新地将回答正确性、置信度校准以及数据集参考准确率三项奖励结合,引导模型在提升性能的同时,学会准确表达自身置信水平。在8个文本与多模态数据集上的实验表明,C3RL在保持准确率不降的前提下,显著改善了置信度校准效果,全面超越现有最佳方法。
基于C3RL校准后的置信度,团队进一步开发了CAS(基于置信度的自适应测试时扩展)策略。该策略可根据模型回答的置信水平,动态分配计算资源——高置信回答减少计算,低置信回答增加计算。实验显示,CAS在领域内外数据集上均优于多数投票法,同时将推理计算量最高降低了12.33倍。
这项研究为大语言模型部署提供了新思路:通过置信度校准提升可靠性,再结合自适应推理实现资源高效利用。团队表示将公开代码、数据与模型。