多阶段大模型文档翻译框架:以马拉地语政府文件为例
印度政府文件多使用马拉地语等地方语言发布,这给非母语读者、跨行政机构及政策分析人员带来了显著的访问障碍。尽管神经机器翻译技术在句子级翻译上已取得进步,但现有系统大多忽略文档结构、格式完整性及领域术语一致性,限制了其在官方文件处理中的应用。
本研究提出了一种结构保持型马拉地语-英语政府文档翻译框架,能够实现端到端的文档转换,同时保持布局保真度。该系统整合了布局感知光学字符识别、基于坐标的文本提取、大模型翻译以及通过HTML表示的结构化文档重建技术。通过强制空间对齐约束并保留层级化文档元素,该框架确保了源文档与译文之间的结构一致性。
在真实世界马拉地语政府PDF文件上的实验评估表明,与传统纯文本翻译流程相比,该框架在结构保持、翻译连贯性和术语一致性方面均有显著提升。该研究为电子政务和行政文档处理的可扩展多语言访问解决方案提供了重要参考,尤其适用于需要严格保持官方文件格式规范的应用场景。