SemHash-LLM:多粒度语义哈希框架,高效实现文档去重

arXiv·18 天前

在应对大规模文档去重任务时,传统方法往往难以兼顾语义准确性与计算效率。近日,arXiv上发布了一项新研究,提出名为SemHash-LLM的多粒度语义哈希框架。该框架创新性地融合了语义投影哈希、注意力加权MinHash、对比边界学习以及基于大语言模型(LLM)的选择性裁决机制。

SemHash-LLM首先通过门控融合技术,整合字符、词元和文档级别的信号,随后采用级联过滤流程高效缩减候选文档。其中,语义投影哈希在蒸馏后的LLM嵌入空间中学习紧凑的二进制编码,而注意力加权MinHash则能有效抑制模板化内容,突出信息丰富的部分。此外,自适应决策边界与不确定性估计进一步提升了框架在模板污染、短文本扰动、包含关系及病毒片段等多种场景下的鲁棒性。

实验结果表明,SemHash-LLM在实现强劲重复检测质量的同时,将神经验证成本控制在百分之一以下,为大规模语料库的高效去重提供了切实可行的解决方案。

文档去重语义哈希大语言模型多粒度学习arXiv研究

原文来源:https://arxiv.org/abs/2607.01601

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回