SemHash-LLM:多粒度语义哈希框架,高效实现文档去重
在应对大规模文档去重任务时,传统方法往往难以兼顾语义准确性与计算效率。近日,arXiv上发布了一项新研究,提出名为SemHash-LLM的多粒度语义哈希框架。该框架创新性地融合了语义投影哈希、注意力加权MinHash、对比边界学习以及基于大语言模型(LLM)的选择性裁决机制。
SemHash-LLM首先通过门控融合技术,整合字符、词元和文档级别的信号,随后采用级联过滤流程高效缩减候选文档。其中,语义投影哈希在蒸馏后的LLM嵌入空间中学习紧凑的二进制编码,而注意力加权MinHash则能有效抑制模板化内容,突出信息丰富的部分。此外,自适应决策边界与不确定性估计进一步提升了框架在模板污染、短文本扰动、包含关系及病毒片段等多种场景下的鲁棒性。
实验结果表明,SemHash-LLM在实现强劲重复检测质量的同时,将神经验证成本控制在百分之一以下,为大规模语料库的高效去重提供了切实可行的解决方案。