LV-ROVER:多流Tesseract投票提升马耳他语段落OCR性能
马耳他语虽有文本语料和预训练语言模型,但针对OCR的训练数据严重不足——目前仅有一个57页的标注PDF语料,远低于段落级训练需求。为解决这一低资源挑战,研究团队构建了合成训练流程,并设计了名为LV-ROVER的五流Tesseract集成系统。在包含422个段落的基准测试中,相比微调后的Tesseract基线(字符错误率0.0234),仅集成识别就将错误率降低44%至0.01317;再经过五阶段后处理流程,最终错误率降至0.00700,整体降低70%。后处理流程主要包括字形规范化,其中一阶段专门修复误读的变音符号而非对齐标点,因此该部分被计入识别增益而非整体后处理效果。研究者指出,44%的错误率降低可视为识别器学习能力的可移植估计,而70%的降幅则与当前基准的标注规范密切相关。这项工作为低资源语言OCR提供了可行的技术路径。