AI如何从众包档案中提取关键词?牛津大学二战数字馆藏案例研究

arXiv·8 天前

大规模识别和分配关键词对众包馆藏而言,既是技术挑战也涉及实践与伦理问题。牛津大学近期发表的研究以‘他们最美好的时刻’在线档案——一个由公众贡献的二战数字馆藏为案例,系统评估了三种自然语言处理方法的自动化关键词提取能力:命名实体识别、关键词提取和主题建模。项目测试了从传统统计方法到现代生成式AI神经网络的一系列人工智能技术。定量与定性分析表明,NLP方法确实为众包馆藏的大规模关键词提取提供了现实潜力,但没有任何单一方法能提供完整解决方案,模型选择会显著影响结果。研究特别指出,在众包馆藏中,元数据直接来源于在世贡献者的参与,自动化关键词提取带来了独特的管理责任,必须与技术性能一并考量。评估发现,开放权重的抽取式模型最有利于支持负责任的应用部署;而生成式AI尽管具备抽象概括潜力,却引入了问责风险,任何管理众包馆藏的相关方都应审慎权衡。

自然语言处理关键词提取众包数据数字人文AI伦理

原文来源:https://arxiv.org/abs/2607.09324

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回