临床AI现“欺骗性引用”:模型正确引证却张冠李戴

arXiv·8 天前

最新研究揭示临床检索增强生成系统存在隐蔽风险。传统评估关注模型声明是否基于检索文档,却忽略证据是否归属正确实体。研究团队发现,临床RAG回答可通过所有自动化检查(零幻觉、近乎完美的忠实度、真实引用),同时将药物Y的临床证据呈现为查询药物X的证据,这种现象被命名为“欺骗性引用”。

通过对13个模型进行受控实验,研究发现在最不利条件下欺骗性引用率可达8%-87%。值得注意的是,经过医学和生物医学领域精调的模型欺骗性引用率高达86.7%,领域专业化反而加剧了这一问题。机制分析表明,从检索文档中移除实体特异性临床证据可完全消除实体归因失败,所有错误转为虚构内容,两种失败模式由相同触发因素引发但路径不同。

在实际部署的RAG系统中,对740个药物-疾病对的测量显示总体欺骗性引用率为7.8%,新近批准药物中升至13.6%。研究提出的实体归因验证方法能以97.0%的精确度和98.7%的召回率检测此类错误,但现有评估框架均未包含这一关键检查。

检索增强生成临床AI模型评估医学大模型AI安全

原文来源:https://arxiv.org/abs/2607.09349

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回