中世纪文本复原新突破:字符级RNN技术实现古文献标准化处理
中世纪文献转录面临两大挑战:不同转录者的习惯差异导致字符集不统一,以及文献数字化过程中的政策不一致。针对这些问题,研究团队开发了一套创新的字符处理方案。
该研究首先训练字符级一对一循环神经网络(RNN),通过自监督学习实现字符集之间的灵活转换。实验表明,即使仅使用20行文本训练,该方法也能将字符错误率(CER)降低一半。这种网络在历史文本识别(HTR)后校正中表现出色,虽然完全忽略插入和删除错误,但仍能带来显著改进。
研究进一步提出‘带状RNN’训练推理模式,利用从平行语料库编译的字符级对齐真值,成功扩展了中世纪特许状转录中的缩写。这种方法能够处理复杂的古文献缩写系统,为历史语言学研究提供了实用工具。
团队还开发了基于启发式算法的字符语义相似度度量方法,能够比较任意两个字符集之间的对应关系。所有方法已集成到功能丰富的Python库中,实现了完整的‘字母词形还原’流程。这项技术为数字人文领域的中世纪文献处理提供了标准化解决方案,有望推动历史文本的数字化研究进程。