基于提示学习自动生成论文亮点,ChatGPT媲美监督方法
学术论文的亮点(Highlights)能精炼概括核心贡献,帮助读者快速把握重点,但许多期刊并未提供该部分内容,限制了其在文献检索、文本挖掘和计量分析中的应用。传统研究多采用监督学习方法自动提取亮点,但这类方法通常需要大量标注训练数据。
近日一项发表于arXiv的研究探索了基于提示学习(Prompt-based Learning)的自动亮点生成方法。研究者设计了任务特定的提示模板,将其与论文摘要结合作为模型输入,评估了包括GPT-2、T5等本地预训练模型以及通过API调用的ChatGPT在内的多种语言模型。
在三个数据集上的实验表明:ChatGPT结合提示模板的表现,在不使用任务特定训练样本的情况下,即可达到与以往监督方法相当的水平。若在提示中加入少量示例,模型在两个数据集上的表现显著超越当前最优方法。
进一步分析提示设计对生成质量的影响发现,尽管ChatGPT具备强大的语言建模能力,但其在此任务上的表现高度依赖提示中所提供的信息。案例研究也显示,生成的亮点整体连贯、信息量充足,且与作者撰写的亮点较为接近。
该研究是首批将提示学习应用于学术亮点生成的工作之一。所提方法不依赖领域特定的训练语料,可为缺乏亮点信息的论文自动生成亮点,从而支持下游文本挖掘与文献计量研究。