谷歌大模型联手,自动筛查医学文献中的EQ-5D研究
随着科学文献数量激增,传统人工筛查系统评价文献的方式日益低效且成本高昂。针对EQ-5D这类需要临床专业判断的健康相关生活质量研究,人工筛选尤其困难。最新研究提出了一种基于大语言模型的自动化解决方案。
研究团队构建了多阶段集成学习框架,结合了小样本提示、加权集成聚合和软堆叠元分类器技术。在PubMed数据库的专家标注数据集上,对9个大语言模型进行了测试。结果显示,由gemini-2.5-pro、gemma-3-12b和gemma-3-27b组成的加权集成模型表现最佳,加权F1分数和准确率均达到0.74,超越了单个模型的性能。
该集成方法在精确率和召回率之间取得了更好平衡,软堆叠策略则提升了系统的可靠性和可解释性。特征分析表明,各模型的概率输出对最终预测具有重要指导作用。这项研究证明,基于大语言模型的集成方案能够为生物医学文献筛查提供可靠、可扩展的自动化工具,有望显著提升系统评价的效率。