ReportMedSAM:用放射学报告引导医学图像分割,告别死板规则

arXiv·4 天前

自由格式的放射学报告蕴含丰富的临床描述信息,但由于自然语言的固有变异性,将其可靠地转化为图像分割指引一直是个挑战。现有方法通常依赖预定义的器官短语或脆弱的基于规则的推理时提取,这限制了其扩展到新解剖结构的能力,并且对语言变化敏感。为此,研究团队提出了ReportMedSAM这一报告驱动的框架。该框架摒弃了离散提取,转而采用一个可学习的概念库。通过利用冻结的医学视觉-语言编码器(BiomedCLIP),团队借助对比学习将器官级概念嵌入与大规模临床语料库对齐,从而建立起相互正交的语义锚点。这种方法明确缓解了器官级语义塌陷问题,并确保了对多样临床同义词(如“renal”与“kidney”)的高度鲁棒性。在推理阶段,临床报告被嵌入并与该概念库进行匹配,以动态激活特定任务的混合专家模块。这种解耦设计允许在不重新训练现有组件的情况下添加新概念和专家,提供了一个参数隔离的扩展机制,同时保持先前学习到的专家不变。在AbdomenAtlas 3.0数据集上的评估表明,ReportMedSAM能有效解读自由格式报告,取得了有竞争力的分割精度,并展示了对新临床任务无缝、无干扰的扩展能力。

医学图像分割视觉-语言模型放射学报告对比学习可扩展AI

原文来源:https://arxiv.org/abs/2607.14116

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回