学术论文多模态数据集问世,助力关键词提取研究突破
传统关键词提取任务通常仅依赖文本数据,忽视了图像和音频模态中的视觉细节与声音特征,导致信息丰富度不足且忽略了潜在的跨模态关联,限制了模型学习数据表示的能力和预测准确性。目前可用于多模态关键词提取的数据集尤为稀缺,进一步阻碍了该领域的研究进展。
为此,研究团队构建了一个包含1000个样本的学术论文多模态数据集,每个样本均包含论文文本、图像、音频及对应关键词。基于无监督和有监督的关键词提取方法,研究团队分别使用论文原始文本、从图像中提取的文本以及从音频转录的文本进行了对比实验,旨在探究不同模态信息及多模态信息融合对关键词提取任务性能的影响。
实验结果表明,不同模态的文本在模型中表现出不同的特征。将论文文本、图像文本和音频文本进行拼接融合,能够有效提升学术论文关键词提取的整体性能。这一发现为多模态自然语言处理任务提供了新的数据支持和研究方向。