医疗AI评估新突破:MedBench v5引入动态过程导向与幻觉监测

arXiv·27 天前

当前医疗AI基准测试普遍存在过程不可见、原子技能评估缺失以及幻觉检测分离等问题。为此,研究团队在arXiv上发布了MedBench v5——一个重新设计的临床多模态模型评估框架,涵盖语言、视觉-语言及智能体系统。该基准实现了从静态问答到动态过程导向评估的范式转变。

MedBench v5的核心创新包括四大维度:首先,采用临床认知响应性(14个子维度)与医疗原子技能(4种智能体环境)的双维框架,覆盖63项具体任务;其次,引入三种可切换的信息流压力源(信息缺失、矛盾证据、证据延迟),支持因子化性能退化分析;第三,建立包含五个推理节点的动态过程审计协议,生成模型特有的失败指纹;第四,首次实现对幻觉传播的全流程监测,涵盖幻觉产生、传播、锚定及矛盾交互等阶段,能够捕捉传统方法难以发现的“沉默幻觉”。

在尖端模型上的实验表明,强大的整体任务性能并不能保证过程稳定性:压力源主要破坏模型的矛盾检测、诊断更新、幻觉传播和基于矛盾的自我修正能力,而最终证据基础可能仍保持表面稳定。这一发现凸显了传统评估指标的局限性。

MedBench v5为临床AI评估提供了统一的基础设施,支持能力画像、可控压力测试、过程审计和幻觉轨迹分析,有望推动医疗AI系统向更可靠、透明和可解释的方向发展。该研究已提交至arXiv预印本平台(编号:2606.24155v1)。

医疗AI基准测试多模态模型幻觉检测过程评估

原文来源:https://arxiv.org/abs/2606.24155

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回