临床文本自杀倾向检测:数据集构建如何影响结果解读

arXiv·31 天前

临床自然语言处理领域正越来越多地利用电子健康记录数据来检测自杀行为,通常将临床文档视为比社交媒体更可靠的真实标签来源。然而最新研究指出,这种认知框架掩盖了基于电子健康记录的自杀倾向数据集如何编码特定的操作化定义——数据由谁记录、事件如何界定、模糊信息如何处理,都会系统性地塑造最终标签。

研究团队以基于MIMIC-III临床笔记构建的ScAN数据集为例展开案例分析,揭示了四个关键影响因素:医院治理约束限制数据获取范围、基于ICD编码的队列选择方法、单一标注者的主观判断、以及按住院期间聚合的标签生成方式。这些因素共同导致数据集标签反映的是临床医生文档化的判断,将自杀倾向视为有明确边界的事件,并假设从文档中能可靠推断患者意图。

语言分析进一步显示,相同的标签下可能包含异质性的临床表述框架,在时间维度、否定表达和不确定性方面存在显著差异。研究者强调,临床自然语言处理领域在将数据集标签视为真实标准前,必须深入审视自杀倾向数据集中嵌入的潜在假设,这对提高心理健康风险检测模型的可靠性和公平性至关重要。

临床NLP电子健康记录心理健康检测数据集偏差自杀倾向分析

原文来源:https://arxiv.org/abs/2606.19637

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回