大模型当老师,小模型做学生:知识蒸馏助力实体匹配数据标注

arXiv·21 天前

传统实体匹配方法依赖大量人工标注数据,而大语言模型虽能实现高精度匹配,却面临推理速度慢、成本高昂的问题。最新研究探索了一种知识蒸馏方案:首先使用GPT-5.2等大模型作为“教师”,自动标注候选实体对的匹配关系;随后将这些机器标注的数据用于训练RoBERTa等轻量级“学生”模型。

研究团队在Abt-Buy、Walmart-Amazon等五个标准数据集上验证了该流程。实验表明,基于机器标注数据训练的轻量模型,其F1分数与使用人工标注数据训练的模型差距不超过2个百分点。成本方面,使用GPT-5.2标注全部五个数据集仅需28.31至40.88美元,而人工标注同等规模数据预计需470小时。推理效率提升更为显著:轻量模型Ditto的推理速度比直接使用大模型快41.5至534倍。

这项成果表明,通过合理的样本选择策略与大模型标注相结合,实体匹配任务可基本摆脱对人工标注数据的依赖,为实际应用提供了高效、低成本的解决方案。

大语言模型知识蒸馏实体匹配数据标注模型优化

原文来源:https://arxiv.org/abs/2606.28823

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回