T2D-Bench:用知识图谱为2型糖尿病AI建议把关,GPT-4o仍有33%证据缺口

arXiv·27 天前

当大语言模型为2型糖尿病患者生成建议时,常出现表述流畅却缺乏临床指南依据的问题。arXiv最新研究提出T2D-Bench评测框架,通过构建多层临床-生活方式知识图谱,首次实现对AI医疗建议的“证据门控”评估。该图谱融合了UMLS生物医学本体、DrugBank药物数据库、SIDER副作用数据、美国糖尿病协会可计算诊疗标准,以及通过机制桥梁关联的生活方式知识库。研究团队设计了100个涵盖诊断、用药安全、生活方式冲突的结构化测试场景。基准测试显示,GPT-4o-mini在35%案例中未能通过证据路径检查,GPT-4o失败率为33%。证据门控系统不仅能检测未经验证的遗漏,还能通过约束修订使输出符合验证级别的证据要求。这项突破意味着,在糖尿病诊疗场景中,不可靠的临床遗漏首次变得可量化、可检测、可纠正。该框架为医疗AI的可信部署提供了新范式,未来可扩展至其他慢性病管理领域。

医疗AI大语言模型知识图谱糖尿病管理可信AI

原文来源:https://arxiv.org/abs/2606.24145

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回