T2D-Bench:用知识图谱为2型糖尿病AI建议把关,GPT-4o仍有33%证据缺口
当大语言模型为2型糖尿病患者生成建议时,常出现表述流畅却缺乏临床指南依据的问题。arXiv最新研究提出T2D-Bench评测框架,通过构建多层临床-生活方式知识图谱,首次实现对AI医疗建议的“证据门控”评估。该图谱融合了UMLS生物医学本体、DrugBank药物数据库、SIDER副作用数据、美国糖尿病协会可计算诊疗标准,以及通过机制桥梁关联的生活方式知识库。研究团队设计了100个涵盖诊断、用药安全、生活方式冲突的结构化测试场景。基准测试显示,GPT-4o-mini在35%案例中未能通过证据路径检查,GPT-4o失败率为33%。证据门控系统不仅能检测未经验证的遗漏,还能通过约束修订使输出符合验证级别的证据要求。这项突破意味着,在糖尿病诊疗场景中,不可靠的临床遗漏首次变得可量化、可检测、可纠正。该框架为医疗AI的可信部署提供了新范式,未来可扩展至其他慢性病管理领域。