论文
SemHash-LLM:用于文档重复数据删除的多粒度语义哈希框架
SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
摘要
大规模文档重复数据删除必须保持语义等效性,同时在大规模语料库上保持高效。我们提出了 SemHash LLM,这是一个多粒度框架,它统一了语义投影哈希、注意力加权 MinHash、对比边界学习和基于选择性 LLM 的裁决。该方法通过门控融合组合字符、标记和文档级信号,然后应用级联过滤管道来有效减少候选者。语义投影哈希在蒸馏的 LLM 嵌入空间中学习紧凑的二进制代码,而注意力加权的最小哈希则抑制样板文件并强调信息内容。自适应决策边界和不确定性估计进一步提高了模板污染、短文本扰动、遏制和病毒片段的稳健性。实验表明,SemHash LLM 以不到百分之一的神经验证成本实现了强大的重复检测质量。