LOOMSUM框架:实现长文档与表格的忠实摘要生成
在学术研究和商业报告中,长文档通常将关键信息分散在大量文本叙述和多个表格中,这给生成忠实摘要带来了巨大挑战。现有方法虽然能生成单独支持的量化事实和分析陈述,但常出现关联错误,导致摘要看似合理却分析不忠实。
针对这一问题,研究团队提出了LOOMSUM框架。该训练免费框架通过三个关键步骤提升摘要质量:首先提取基于源的原子证据,然后显式链接表格衍生的事实与支持性叙述分析,最后在生成前规划话语结构。这种方法确保量化信息与文本解释正确对应。
团队同时引入了表格接地忠实度(TGF)指标,该指标在声明层面分别评估数值接地、分析支持和关系一致性三个维度。在FINDSum和USTT这两个文本-表格摘要基准测试中,LOOMSUM在保持强摘要质量的同时,显著提升了分析忠实度。
人工评估显示,LOOMSUM的组件级表现与相应的人工判断呈正相关。特别值得注意的是,其关系一致性指标与人类关系判断的一致性优于通用事实性指标,这表明显式的跨模态链接有助于减少“支持的数量与错误的叙述解释配对”这类错误。
这些发现共同表明,忠实的长文本-表格摘要不仅需要接地个体事实,更需要保持事实之间的关系。该研究为处理复杂多模态文档的摘要系统提供了新的思路和方法论基础。