科研文档跨版本比对新突破:布局感知与结构推理实现多元素精准差异分析

arXiv·4 天前

在学术出版和技术文档管理中,科学文档的跨版本比对至关重要,但传统方法面临挑战。科学文档是包含文本、表格、公式、图形和布局线索等多种异构元素的页面结构化产物。现有基于文本序列的方法常丢失布局和结构信息,而基于图像的方法则缺乏语义可解释性且对渲染变化敏感。

为此,研究团队提出了一种布局感知的异构元素感知框架。该框架将文档版本分解为语义类型化的元素,通过“对齐优先”机制建立跨版本对应关系,该机制联合建模空间、内容和结构兼容性,并对已对齐的元素对执行类型感知的差异推理。

该方法支持跨文本、表格、公式和图形的统一变更检测、定位、结构感知分析以及对齐/匹配评估。在来自期刊生产校对工作流的真实科学PDF数据上的实验表明,该框架性能持续优于特定元素的基线方法。对于文本、表格、公式和图形,其检测F1分数分别达到0.903、0.855、0.862和0.845,在定位、结构感知和匹配质量方面还有进一步提升。消融和敏感性分析证实了跨版本对齐、类型特定表示、结构感知推理和兼容性权重设计的有效性。这些结果表明,异构元素感知的差异分析为现实编辑生产场景中的科学文档比较提供了稳健且可解释的解决方案。

文档处理多模态AI学术出版PDF解析布局分析

原文来源:https://arxiv.org/abs/2607.14117

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回