AI如何从众包档案中提取关键词?牛津大学二战数字馆藏案例研究
大规模识别和分配关键词对众包馆藏而言,既是技术挑战也涉及实践与伦理问题。牛津大学近期发表的研究以‘他们最美好的时刻’在线档案——一个由公众贡献的二战数字馆藏为案例,系统评估了三种自然语言处理方法的自动化关键词提取能力:命名实体识别、关键词提取和主题建模。项目测试了从传统统计方法到现代生成式AI神经网络的一系列人工智能技术。定量与定性分析表明,NLP方法确实为众包馆藏的大规模关键词提取提供了现实潜力,但没有任何单一方法能提供完整解决方案,模型选择会显著影响结果。研究特别指出,在众包馆藏中,元数据直接来源于在世贡献者的参与,自动化关键词提取带来了独特的管理责任,必须与技术性能一并考量。评估发现,开放权重的抽取式模型最有利于支持负责任的应用部署;而生成式AI尽管具备抽象概括潜力,却引入了问责风险,任何管理众包馆藏的相关方都应审慎权衡。