AI医疗新突破:知识图谱增强大模型生成临床试验摘要的准确性
在医疗健康领域,大语言模型正被越来越多地用于为医生、患者和支付方等不同受众生成临床试验结果摘要。然而,模型固有的“幻觉”倾向在这一高风险场景中带来了显著风险。
近日,研究人员在arXiv发布了一项重要研究,首次建立了专门评估大模型生成临床试验摘要忠实度的基准框架。该框架从ClinicalTrials.gov数据库中选取了200项分层试验,针对三类受众设计了特定的提示模板,并采用六维度的忠实度标注体系进行评估。
研究团队对GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash三大主流模型进行了基线测试,基于交叉编码器自然语言推理模型对1800份生成摘要进行评分。结果显示,“无依据陈述”是所有模型最主要的失败模式,平均标注得分仅为1.55分(满分3分)。
为应对这一挑战,研究人员开发了知识图谱增强检索系统。实验表明,该系统在基于NLI的忠实度评分上取得了统计学显著提升(蕴含分数提升0.0125,忠实度提升0.0130,p<0.0001)。有趣的是,不同模型的改进路径存在差异:GPT-4o主要通过减少矛盾陈述获得提升,而Claude Sonnet 4.6和Gemini 2.5 Flash则通过增加蕴含关系实现进步。
这项研究为医疗AI应用提供了重要的质量控制方法,有望推动大语言模型在临床决策支持中的安全部署。