CORTEX:基于内部表征对比的RAG幻觉检测新方法

arXiv·20 天前

在检索增强生成(RAG)系统中,模型生成的答案有时会包含与检索文档不符的虚假信息,这种现象被称为“幻觉”。传统方法往往在句子或段落层面检测幻觉,但实际应用中,幻觉可能仅出现在局部片段中。为此,研究团队提出了CORTEX方法,专注于token级别的幻觉检测。

CORTEX的核心思想是:基于检索文档生成的token,其内部表征应比幻觉token更受文档影响。该方法通过对比大语言模型在有检索文档和无检索文档两种条件下的内部表征差异,识别每个token的“接地性”。与仅关注单个token对文档敏感度的方案不同,CORTEX还考虑了文档信息通过前序token的传播效应,从而减少对已吸收证据token的误判。

此外,研究团队引入了后处理平滑步骤,模拟幻觉标签在连续片段中的持续性,降低局部噪声,提升预测一致性。在两项RAG基准测试和三种大语言模型上的实验表明,CORTEX显著提升了token级幻觉检测性能,各组件均对效果提升有稳定贡献。该方法为RAG系统的可靠性评估提供了更精细的工具,有望推动可信生成技术的发展。

RAG幻觉检测大语言模型可信AI自然语言处理

原文来源:https://arxiv.org/abs/2606.31033

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回