PORTER模型:打破电子病历固定词表限制,实现跨机构医疗AI迁移

arXiv·27 天前

传统电子病历基础模型通常将临床事件编码为固定词表中的离散标记,这导致模型无法处理包含新概念或新属性组合的医疗事件,严重限制了跨机构甚至同一机构内不同部署管道间的迁移能力。针对这一瓶颈,研究团队开发了PORTER模型,采用语言驱动的结构化表示方案。该模型创新性地使用冻结文本编码器通过事件描述来表征临床事件,通过专用路径整合数值信息,并利用自回归预训练时序主干学习患者时间线上的临床动态。在儿科医院的74项临床预测任务测试中,PORTER在保持相同时序主干和预训练目标的情况下,其平均AUROC指标与固定词表模型相当。当使用预训练期间未见的事件描述呈现相同患者时间线时,PORTER无需重新训练或词表映射即可实现迁移,恢复了目标词表直接训练模型97.1%的平均AUROC性能。在迁移至MIMIC数据集时,PORTER显著优于固定词表模型——后者因69%的事件标记未被见过而性能大幅下降。机制分析表明,跨词表迁移能力取决于患者层面表示几何结构的保持程度,而非文本编码器的规模;数值路径在不破坏临床概念身份的前提下增强了对数值大小的敏感性。此外,PORTER在比任务特定文本序列化对比模型低329倍摊销计算成本的情况下,仍实现了更高的AUROC。这项研究为实现词表独立的电子病历基础模型迈出重要一步,在保持领域内性能的同时减少词表协调需求,支持高效的跨任务复用。

医疗AI电子病历基础模型迁移学习自然语言处理

原文来源:https://arxiv.org/abs/2606.24102

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回