临床AI现“欺骗性引用”:模型正确引证却张冠李戴
最新研究揭示临床检索增强生成系统存在隐蔽风险。传统评估关注模型声明是否基于检索文档,却忽略证据是否归属正确实体。研究团队发现,临床RAG回答可通过所有自动化检查(零幻觉、近乎完美的忠实度、真实引用),同时将药物Y的临床证据呈现为查询药物X的证据,这种现象被命名为“欺骗性引用”。
通过对13个模型进行受控实验,研究发现在最不利条件下欺骗性引用率可达8%-87%。值得注意的是,经过医学和生物医学领域精调的模型欺骗性引用率高达86.7%,领域专业化反而加剧了这一问题。机制分析表明,从检索文档中移除实体特异性临床证据可完全消除实体归因失败,所有错误转为虚构内容,两种失败模式由相同触发因素引发但路径不同。
在实际部署的RAG系统中,对740个药物-疾病对的测量显示总体欺骗性引用率为7.8%,新近批准药物中升至13.6%。研究提出的实体归因验证方法能以97.0%的精确度和98.7%的召回率检测此类错误,但现有评估框架均未包含这一关键检查。