LA-RL:让大模型学会“诊断式”自我纠错,信息抽取性能显著提升
大语言模型在信息抽取任务中展现出强大潜力,但现有的自我反思修正方法往往与结构化输出不匹配。传统自由形式的反思只能标记错误,却难以准确定位错误类型——究竟是缺失片段、标签错误、边界不匹配、无效关系类型还是参数顺序颠倒。
针对这一问题,研究团队提出了LA-RL(标签感知反思强化学习)框架。该框架采用结果监督方式,使用任务诊断标签引导信息抽取的自我修正过程。单个骨干模型首先预测抽取结果,然后诊断特定任务错误标签,最后根据诊断结果修正输出。
训练过程从标注模型生成的诊断数据开始,进行冷启动监督微调,随后通过两个GRPO阶段进行强化学习,奖励最终抽取质量、格式有效性和首次预测正确性,无需过程奖励模型。
实验结果显示,在命名实体识别、关系抽取和事件抽取任务上,LA-RL相比标准监督微调均取得一致性能提升:SciER关系抽取平均F1提升6.83,分布外关系抽取提升约20 F1,DuEE1.0事件抽取中触发词F1提升14.80、论元F1提升17.50。消融研究表明,反思结构具有任务敏感性:更强约束有利于关系抽取,而命名实体识别在领域转移时需要限制较少的修正。