AI医疗新突破:知识图谱增强大模型生成临床试验摘要的准确性

arXiv·7 天前

在医疗健康领域,大语言模型正被越来越多地用于为医生、患者和支付方等不同受众生成临床试验结果摘要。然而,模型固有的“幻觉”倾向在这一高风险场景中带来了显著风险。

近日,研究人员在arXiv发布了一项重要研究,首次建立了专门评估大模型生成临床试验摘要忠实度的基准框架。该框架从ClinicalTrials.gov数据库中选取了200项分层试验,针对三类受众设计了特定的提示模板,并采用六维度的忠实度标注体系进行评估。

研究团队对GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash三大主流模型进行了基线测试,基于交叉编码器自然语言推理模型对1800份生成摘要进行评分。结果显示,“无依据陈述”是所有模型最主要的失败模式,平均标注得分仅为1.55分(满分3分)。

为应对这一挑战,研究人员开发了知识图谱增强检索系统。实验表明,该系统在基于NLI的忠实度评分上取得了统计学显著提升(蕴含分数提升0.0125,忠实度提升0.0130,p<0.0001)。有趣的是,不同模型的改进路径存在差异:GPT-4o主要通过减少矛盾陈述获得提升,而Claude Sonnet 4.6和Gemini 2.5 Flash则通过增加蕴含关系实现进步。

这项研究为医疗AI应用提供了重要的质量控制方法,有望推动大语言模型在临床决策支持中的安全部署。

大语言模型医疗AI临床试验知识图谱模型评估

原文来源:https://arxiv.org/abs/2607.09932

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回