AI为伏尔泰全集自动标注主题:文学大语料库的智能索引新突破

arXiv·8 天前

在数字人文研究领域,如何高效处理海量文学历史文献一直是个难题。传统主题索引工作需要专业人员手动标注文本段落的概念标签,耗时耗力且难以规模化。近日,一项基于机器学习的新研究为这一困境提供了智能解决方案。

研究团队选取伏尔泰全集中的《论各民族风俗与精神》和《百科全书问题》两个重要子语料库作为测试对象,将主题索引任务构建为多标签分类问题。研究比较了从编码器模型到生成式大语言模型(LLM)的多种技术路径,模型参数量从30亿到1200亿不等,其中基于Mistral家族的4位量化模型表现最佳。

值得注意的是,虽然模型预测与印刷版索引存在差异,但许多预测在语义层面仍然有效,这反映了专业索引本身存在的主观性。研究还评估了模型在跨语料库的泛化能力,并对文学修辞特征等自动化处理难点进行了深入分析。

这项成果不仅为伏尔泰研究提供了实用工具,更为大规模文学历史语料库的结构化主题访问提供了可复制的技术框架,有望推动数字人文研究方法的革新。

自然语言处理数字人文大语言模型文本分类伏尔泰研究

原文来源:https://arxiv.org/abs/2607.09316

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回