大语言模型不确定性估计新发现:内部信号如何影响幻觉检测效果
基于探针的不确定性估计已成为检测大语言模型幻觉的主流方法,通过模型内部信号学习不确定性。然而,现有方法在特征设计、训练数据构建和评估设置上差异较大,难以确定性能提升的关键因素。为此,研究团队在匹配条件下对探针式不确定性估计进行了分解研究。结果显示:在域内任务中,原始隐藏状态和注意力特征难以被超越;但在分布偏移场景下,结构化压缩特征表现出更强的鲁棒性,表明仅凭域内性能不足以衡量进展。研究还发现,提示词设计和标签构建会显著影响探针行为。基于这些最佳实践,团队训练了基于基准的预训练探针,在开放式事实生成任务中展现出良好的迁移能力,为社区提供了稳定的即用基线。该研究倡导对不确定性估计器进行更贴近实际部署的评估。代码已开源。