CLIR-Bench:首个专为不规则临床时序数据问答设计的评测基准

arXiv·7 天前

临床时间序列数据(如ICU监护记录)对患者监测和临床决策至关重要,但这些数据往往存在采样稀疏、时间间隔不规则、不同变量异步记录等特点,给AI模型的时序推理带来巨大挑战。现有医学问答基准多基于规整时序或静态数据,难以评估模型能否从真实临床场景的不规则观测中准确提取证据。

为此,研究团队构建了CLIR-Bench——首个专门针对不规则临床时间序列问答的评测基准。该基准通过四阶段标准化流程,基于脱敏ICU记录构建了6,600个问答实例,覆盖11项临床变量,并划分为4大能力维度和11项具体任务。每个问题均关联明确的时序证据链和答案推导规则,既可评估答案准确性,也能检验模型是否真正依据时序证据进行推理。

实验表明,当前通用模型在稀疏临床证据的检索与推理上表现不佳,突显了开发更强不规则时序推理方法的迫切性。该基准已开源,旨在推动临床时序AI研究向更贴近真实场景的方向发展。

医疗AI时序数据问答系统评测基准临床决策

原文来源:https://arxiv.org/abs/2607.09880

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回