大模型校准评估新突破:准确率控制框架揭示排名反转现象
在大型语言模型评估中,校准性能衡量模型置信度与其实证准确率的一致性。现有研究通常使用预期校准误差和Brier分数等全局指标进行模型间比较。最新研究发现,这种比较方法受到模型准确率差异的干扰,可能导致不公平的评估结果。
研究团队通过理论和实证分析证明,准确率差异会混淆校准比较。为此,他们提出了ACE(准确率控制评估)框架,包含三个互补视角:实例对齐校准、分布对齐校准和候选对齐校准。该框架在多个基准测试、模型家族和置信度获取方法中得到验证。
研究重点关注两个实际比较维度:小型与大型模型的对比,以及思考型与非思考型模型的对比。结果显示,在原始全局指标下报告的许多校准优势,在准确率控制后显著减弱。更值得注意的是,排名反转现象频繁发生:原始指标偏好的模型在准确率控制后往往不再具有优势。
这项研究揭示了传统校准评估方法的局限性,表明公平的校准比较需要采用准确率感知的评估方法。ACE框架为研究人员提供了更可靠的跨模型校准比较工具,有助于推动大模型评估标准的发展。研究成果已提交至arXiv预印本平台,为后续研究提供了重要参考。