CORTEX:基于内部表征对比的RAG幻觉检测新方法
在检索增强生成(RAG)系统中,模型生成的答案有时会包含与检索文档不符的虚假信息,这种现象被称为“幻觉”。传统方法往往在句子或段落层面检测幻觉,但实际应用中,幻觉可能仅出现在局部片段中。为此,研究团队提出了CORTEX方法,专注于token级别的幻觉检测。
CORTEX的核心思想是:基于检索文档生成的token,其内部表征应比幻觉token更受文档影响。该方法通过对比大语言模型在有检索文档和无检索文档两种条件下的内部表征差异,识别每个token的“接地性”。与仅关注单个token对文档敏感度的方案不同,CORTEX还考虑了文档信息通过前序token的传播效应,从而减少对已吸收证据token的误判。
此外,研究团队引入了后处理平滑步骤,模拟幻觉标签在连续片段中的持续性,降低局部噪声,提升预测一致性。在两项RAG基准测试和三种大语言模型上的实验表明,CORTEX显著提升了token级幻觉检测性能,各组件均对效果提升有稳定贡献。该方法为RAG系统的可靠性评估提供了更精细的工具,有望推动可信生成技术的发展。