LV-ROVER:多流Tesseract投票提升马耳他语段落OCR性能

arXiv·19 天前

马耳他语虽有文本语料和预训练语言模型,但针对OCR的训练数据严重不足——目前仅有一个57页的标注PDF语料,远低于段落级训练需求。为解决这一低资源挑战,研究团队构建了合成训练流程,并设计了名为LV-ROVER的五流Tesseract集成系统。在包含422个段落的基准测试中,相比微调后的Tesseract基线(字符错误率0.0234),仅集成识别就将错误率降低44%至0.01317;再经过五阶段后处理流程,最终错误率降至0.00700,整体降低70%。后处理流程主要包括字形规范化,其中一阶段专门修复误读的变音符号而非对齐标点,因此该部分被计入识别增益而非整体后处理效果。研究者指出,44%的错误率降低可视为识别器学习能力的可移植估计,而70%的降幅则与当前基准的标注规范密切相关。这项工作为低资源语言OCR提供了可行的技术路径。

OCR低资源语言Tesseract多模型集成马耳他语

原文来源:https://arxiv.org/abs/2607.00250

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回