IMCBench:首个图像对话医学基准,评测多模态大模型临床能力
随着大语言模型与视觉语言模型在多模态推理能力上的突破,AI在临床决策支持与分诊等场景的应用潜力日益凸显。然而,现有医学AI评测体系存在局限:部分支持多轮对话但缺乏图像输入,另一些虽提供多模态输入却仅关注单轮问答任务。为填补这一空白,研究团队提出了IMCBench——一个基于图像的多轮医学对话基准。该基准将真实公开的临床图像与合成的患者档案配对,模拟真实的医患互动场景。
每段对话从三个临床维度进行评估:安全性、诊断准确性以及对诊断不确定性的恰当表达。研究团队对来自四个模型系列(Claude、GPT、Nova和Llama)的八款前沿多模态模型进行了评测,采用“LLM-as-Jury”评分机制(以临床专家标注为校准基准)进行1-5分制打分。结果显示,Claude Opus 4.6以3.61分获得最高综合得分,紧随其后的是Claude Sonnet 4.6(3.30分)和GPT-5.2(3.29分)。值得注意的是,没有模型能在所有维度上占据优势,且在恶性与罕见病症场景下,所有模型的安全性评分均出现下降(平均降幅Δ=-0.27)。
消融实验进一步揭示,视觉输入与电子健康记录(EHR)上下文均对生成安全的诊疗建议具有贡献——当移除任一项时,安全性平均分别下降0.18和0.23分,且性能更强的模型能更有效地利用视觉特征。这些发现共同表明,准确的临床描述并不等同于安全的患者指导,这凸显了在医学AI领域建立多维度评估框架的必要性。