中世纪文本复原新突破:字符级RNN技术实现古文献标准化处理

arXiv·8 天前

中世纪文献转录面临两大挑战:不同转录者的习惯差异导致字符集不统一,以及文献数字化过程中的政策不一致。针对这些问题,研究团队开发了一套创新的字符处理方案。

该研究首先训练字符级一对一循环神经网络(RNN),通过自监督学习实现字符集之间的灵活转换。实验表明,即使仅使用20行文本训练,该方法也能将字符错误率(CER)降低一半。这种网络在历史文本识别(HTR)后校正中表现出色,虽然完全忽略插入和删除错误,但仍能带来显著改进。

研究进一步提出‘带状RNN’训练推理模式,利用从平行语料库编译的字符级对齐真值,成功扩展了中世纪特许状转录中的缩写。这种方法能够处理复杂的古文献缩写系统,为历史语言学研究提供了实用工具。

团队还开发了基于启发式算法的字符语义相似度度量方法,能够比较任意两个字符集之间的对应关系。所有方法已集成到功能丰富的Python库中,实现了完整的‘字母词形还原’流程。这项技术为数字人文领域的中世纪文献处理提供了标准化解决方案,有望推动历史文本的数字化研究进程。

自然语言处理历史文本处理循环神经网络字符标准化数字人文

原文来源:https://arxiv.org/abs/2607.09291

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回