MedRealMM:首个基于真实医患对话的多模态中文在线问诊评测基准发布
随着大语言模型在在线医疗咨询中的应用日益广泛,现有评测基准与真实临床实践脱节的问题逐渐凸显。多数基准依赖合成对话或模拟患者,忽略患者上传的医学影像,或使用选择题、词汇重叠等与临床质量关联度低的评价方式。
为此,研究团队基于中国全国性互联网医院脱敏的真实医患交互数据,推出了大规模多模态在线医疗咨询基准MedRealMM。该基准采用“多模态临床挑战点”提取框架,从真实咨询轨迹中识别临床需求密集的关键节点,并将其转化为标准化的下一轮回复生成任务,同时保留前序的文本-图像上下文。每个实例均配有经医师细化的病例特异性评分标准,奖励符合临床期望的行为,惩罚不安全、无依据或自相矛盾的回复。
当前发布的版本包含5620个真实世界多模态病例,覆盖64个临床科室。团队评估了19个通用及医疗专用大语言模型(包括纯文本与多模态系统),结果显示:图像信息对可靠的临床表现至关重要,而当前前沿模型的表现仍低于在线医师回复水平。尽管部分前沿模型在满足阳性临床标准方面达到甚至超过医师,但其触发的阴性标准更多,表明在安全敏感的错误规避方面仍是主要瓶颈。
MedRealMM为评估真实世界在线咨询中的多模态医疗推理提供了现实且可复现的基准。数据集已在Hugging Face平台公开。