科学领域实体链接新突破:Sci-ZSEL框架实现零标注高效对齐

arXiv·1 天前

科学领域的实体链接面临独特挑战:专业术语与通用预训练模型词汇不匹配,且实体名称与提及词之间常缺乏词汇重叠。传统方法依赖领域内微调,但许多科学领域缺乏专家标注数据。现有零样本方法虽利用大语言模型生成别名,却面临计算成本高且无法过滤噪声的问题。

针对这些难题,研究团队提出Sci-ZSEL创新框架。该框架采用选择性别名生成策略,仅对关键实体调用大语言模型,有效控制计算开销。同时引入本体感知过滤器,可识别并剔除语义漂移至相邻本体的噪声别名。过滤后的别名用于构建伪标注的提及-实体对,进而训练专用链接模型。

为评估低词汇重叠场景下的性能,团队同步发布了动物科学实体链接基准数据集,该数据集链接三个畜牧性状本体,其词汇重叠率显著低于现有基准。在五个基准测试中,Sci-ZSEL均优于未微调的基线模型,在非重叠提及场景表现尤为突出,与人工整理同义词结合时达到最佳性能。这项工作为零标注科学知识图谱构建提供了实用解决方案。

实体链接科学NLP零样本学习大语言模型应用知识图谱

原文来源:https://arxiv.org/abs/2609.00228

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回