LOOMSUM框架:实现长文档与表格的忠实摘要生成

arXiv·1 天前

在学术研究和商业报告中,长文档通常将关键信息分散在大量文本叙述和多个表格中,这给生成忠实摘要带来了巨大挑战。现有方法虽然能生成单独支持的量化事实和分析陈述,但常出现关联错误,导致摘要看似合理却分析不忠实。

针对这一问题,研究团队提出了LOOMSUM框架。该训练免费框架通过三个关键步骤提升摘要质量:首先提取基于源的原子证据,然后显式链接表格衍生的事实与支持性叙述分析,最后在生成前规划话语结构。这种方法确保量化信息与文本解释正确对应。

团队同时引入了表格接地忠实度(TGF)指标,该指标在声明层面分别评估数值接地、分析支持和关系一致性三个维度。在FINDSum和USTT这两个文本-表格摘要基准测试中,LOOMSUM在保持强摘要质量的同时,显著提升了分析忠实度。

人工评估显示,LOOMSUM的组件级表现与相应的人工判断呈正相关。特别值得注意的是,其关系一致性指标与人类关系判断的一致性优于通用事实性指标,这表明显式的跨模态链接有助于减少“支持的数量与错误的叙述解释配对”这类错误。

这些发现共同表明,忠实的长文本-表格摘要不仅需要接地个体事实,更需要保持事实之间的关系。该研究为处理复杂多模态文档的摘要系统提供了新的思路和方法论基础。

文本摘要多模态AINLP研究表格处理arXiv

原文来源:https://arxiv.org/abs/2609.00241

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回