TELLER:双路径迭代优化,提升表格实体链接准确率

arXiv·31 天前

在自然语言处理领域,表格实体链接任务旨在将表格中简短且含义模糊的单元格内容,准确匹配到知识库中的对应实体。传统方法通常依赖数据预处理流程,保留精简或完整的表格内容作为上下文证据,然后将实体链接转化为指令调优模型的语言生成任务。近期系统进一步引入显式推理机制来处理具有挑战性的歧义实体,但这些方法的训练监督往往是静态的:固定的偏好数据无法适应模型演化过程中的残留误差,而推理长度的变化又可能导致序列级偏好学习产生偏差。

针对这些局限,研究团队提出了TELLER框架。该框架首先检索并排序维基数据候选实体,在提示中保留精简的表格证据。其创新之处在于采用双路径迭代优化策略:直接答案路径应用迭代直接偏好优化,并利用更新模型产生的残留误差刷新偏好数据;推理路径则使用经过筛选和压缩的思维链推理进行监督微调,随后执行迭代长度归一化正则化偏好优化。

实验结果显示,在TableInstruct实体链接子集上,直接答案路径将准确率从94.35%提升至94.50%;在MammoTab V2评估集上,准确率从87.59%提高到88.20%。推理路径在TableInstruct上的准确率从92.90%提升至92.95%,在MammoTab V2上从79.09%显著提升至81.85%,同时保持了较高的完整推理生成率。这些成果表明,迭代偏好学习方法能够同时优化简洁实体预测和显式推理过程,为表格实体链接任务提供了新的有效解决方案。

实体链接表格处理偏好优化NLP知识库

原文来源:https://arxiv.org/abs/2607.28680

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回