新算法C3RL:让大语言模型学会“诚实”表达自信度

arXiv·18 天前

当前大语言模型通过强化学习训练后,性能虽有提升,却常出现“过度自信”的问题——在不确定时仍给出高置信度的错误答案。arXiv最新研究《Scaling with Confidence》针对此缺陷,提出了C3RL(正确性与置信度校准强化学习)算法。

C3RL创新地将回答正确性、置信度校准以及数据集参考准确率三项奖励结合,引导模型在提升性能的同时,学会准确表达自身置信水平。在8个文本与多模态数据集上的实验表明,C3RL在保持准确率不降的前提下,显著改善了置信度校准效果,全面超越现有最佳方法。

基于C3RL校准后的置信度,团队进一步开发了CAS(基于置信度的自适应测试时扩展)策略。该策略可根据模型回答的置信水平,动态分配计算资源——高置信回答减少计算,低置信回答增加计算。实验显示,CAS在领域内外数据集上均优于多数投票法,同时将推理计算量最高降低了12.33倍。

这项研究为大语言模型部署提供了新思路:通过置信度校准提升可靠性,再结合自适应推理实现资源高效利用。团队表示将公开代码、数据与模型。

大语言模型强化学习置信度校准推理优化arXiv

原文来源:https://arxiv.org/abs/2607.01612

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回