大语言模型不确定性估计新发现:内部信号如何影响幻觉检测效果

arXiv·22 天前

基于探针的不确定性估计已成为检测大语言模型幻觉的主流方法,通过模型内部信号学习不确定性。然而,现有方法在特征设计、训练数据构建和评估设置上差异较大,难以确定性能提升的关键因素。为此,研究团队在匹配条件下对探针式不确定性估计进行了分解研究。结果显示:在域内任务中,原始隐藏状态和注意力特征难以被超越;但在分布偏移场景下,结构化压缩特征表现出更强的鲁棒性,表明仅凭域内性能不足以衡量进展。研究还发现,提示词设计和标签构建会显著影响探针行为。基于这些最佳实践,团队训练了基于基准的预训练探针,在开放式事实生成任务中展现出良好的迁移能力,为社区提供了稳定的即用基线。该研究倡导对不确定性估计器进行更贴近实际部署的评估。代码已开源。

大语言模型不确定性估计幻觉检测模型评估机器学习

原文来源:https://arxiv.org/abs/2606.27679

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回