LA-RL:让大模型学会“诊断式”自我纠错,信息抽取性能显著提升

arXiv·37 天前

大语言模型在信息抽取任务中展现出强大潜力,但现有的自我反思修正方法往往与结构化输出不匹配。传统自由形式的反思只能标记错误,却难以准确定位错误类型——究竟是缺失片段、标签错误、边界不匹配、无效关系类型还是参数顺序颠倒。

针对这一问题,研究团队提出了LA-RL(标签感知反思强化学习)框架。该框架采用结果监督方式,使用任务诊断标签引导信息抽取的自我修正过程。单个骨干模型首先预测抽取结果,然后诊断特定任务错误标签,最后根据诊断结果修正输出。

训练过程从标注模型生成的诊断数据开始,进行冷启动监督微调,随后通过两个GRPO阶段进行强化学习,奖励最终抽取质量、格式有效性和首次预测正确性,无需过程奖励模型。

实验结果显示,在命名实体识别、关系抽取和事件抽取任务上,LA-RL相比标准监督微调均取得一致性能提升:SciER关系抽取平均F1提升6.83,分布外关系抽取提升约20 F1,DuEE1.0事件抽取中触发词F1提升14.80、论元F1提升17.50。消融研究表明,反思结构具有任务敏感性:更强约束有利于关系抽取,而命名实体识别在领域转移时需要限制较少的修正。

大语言模型信息抽取自我反思强化学习自然语言处理

原文来源:https://arxiv.org/abs/2607.23420

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回