大模型当老师,小模型做学生:知识蒸馏助力实体匹配数据标注
传统实体匹配方法依赖大量人工标注数据,而大语言模型虽能实现高精度匹配,却面临推理速度慢、成本高昂的问题。最新研究探索了一种知识蒸馏方案:首先使用GPT-5.2等大模型作为“教师”,自动标注候选实体对的匹配关系;随后将这些机器标注的数据用于训练RoBERTa等轻量级“学生”模型。
研究团队在Abt-Buy、Walmart-Amazon等五个标准数据集上验证了该流程。实验表明,基于机器标注数据训练的轻量模型,其F1分数与使用人工标注数据训练的模型差距不超过2个百分点。成本方面,使用GPT-5.2标注全部五个数据集仅需28.31至40.88美元,而人工标注同等规模数据预计需470小时。推理效率提升更为显著:轻量模型Ditto的推理速度比直接使用大模型快41.5至534倍。
这项成果表明,通过合理的样本选择策略与大模型标注相结合,实体匹配任务可基本摆脱对人工标注数据的依赖,为实际应用提供了高效、低成本的解决方案。