基于BART的分层策略实现越南语多文档摘要生成

arXiv·31 天前

在越南语言与语音处理国际研讨会(VLSP 2022)提出的越南语多文档摘要任务中,研究团队开发了一种创新的分层处理方案。该方法采用BART模型作为基础架构,首先对每个输入文档进行内容压缩,随后进行信息聚合与最终摘要生成。

关键技术突破在于提出了一种由黄金摘要驱动的文档压缩策略,该策略通过参考标准摘要内容来指导文档精简过程,确保分层处理各阶段之间的高度相关性。实验结果显示,该方法在VLSP公开测试集上取得了0.2468的ROUGE2-F1分数,生成的摘要既流畅又简洁。

为应对越南语多文档摘要数据稀缺的挑战,研究团队还整合了外部数据源,显著扩充了训练数据规模。这些额外数据已向研究社区公开,为后续相关研究提供了宝贵资源。该工作为低资源语言的自动摘要任务提供了新的技术思路和实践参考。

文本摘要多文档处理越南语NLPBART模型VLSP竞赛

原文来源:https://arxiv.org/abs/2606.19591

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回