医疗AI新基准:LongMedBench评估大模型长期临床决策能力

arXiv·8 天前

近日,研究团队在arXiv发布了医疗AI领域的重要基准LongMedBench,专门用于评估基于大语言模型的医疗代理在长期临床决策中的能力。传统评估多聚焦于短文本知识问答和工具使用,但真实医疗场景本质上是纵向的,医生需要综合患者多次就诊、检验和治疗演变的信息进行判断。

LongMedBench通过可复现的流程构建,将MIMIC-IV入院记录和临床笔记整合为时序事件流和长上下文记忆数据集,支持医疗代理与临床环境进行多轮次、长时程的交互。基准涵盖335名患者,平均每人19.72次住院就诊,每次就诊包含44.91个医疗事件。

研究团队提出三级评估体系:事实性问答测试基础知识掌握,时序推理考察时间关系理解,长期决策评估综合历史信息做出临床判断的能力。实验发现,当前大模型虽能较好利用显式时间戳,但在隐式时间推断上仍存在挑战;检索增强生成和记忆系统能提升信息检索任务表现,但决策任务性能高度依赖模型的即时上下文处理能力。

该基准的建立为医疗AI系统向真实临床工作流迈进提供了重要评估工具,未来可推动更符合实际医疗需求的智能辅助系统发展。

医疗AI临床决策基准测试大语言模型电子病历

原文来源:https://arxiv.org/abs/2607.09322

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回