大语言模型在医学推理中展现元认知敏感性

arXiv·16 天前

随着大语言模型在医疗领域的应用日益增多,其临床价值不仅取决于答案的准确性,还涉及模型对证据质量和不确定性的自信程度是否合理。一项最新研究通过受控的心理学实验方法,构建了一个医疗诊断基准测试,专注于区分阿尔茨海默型神经认知障碍与抑郁相关认知障碍。研究团队生成了45个合成病例,涵盖不同证据强度、冲突信息和缺失数据,并采用三种提示变体进行测试,共完成135次试验。在初步使用gpt-4.1-nano模型的试验中,所有测试均输出了有效结构化结果。结果显示,模型在强制选择诊断中的准确率达到93.5%,平均自信度为78.4%,AUROC2值为0.876。模型自信度随证据与诊断边界距离增加而提升,在信息缺失时降低,且在调整证据强度和提示格式后,正确诊断的自信度高于错误诊断。这表明模型具备部分元认知敏感性,而非完全无依据的自信。然而,模型错误主要集中在中等强度、证据冲突的阿尔茨海默病例中,此时模型倾向于诊断为抑郁相关障碍,且自信度高于实际准确率所能支持的水平。研究强调,评估医疗大语言模型时,应直接测量其自信质量,而非仅依赖基准准确率或模型能力推断。该工作为系统评估模型证据敏感性、元认知能力及局部校准失效提供了可重复框架。

大语言模型医疗AI元认知诊断准确率模型评估

原文来源:https://arxiv.org/abs/2608.14552

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回