论文

用于检索增强生成系统的交叉注意力校准重复数据删除

Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System

摘要

检索增强生成 (RAG) 系统中常见的分块策略通常会创建冗余块。这些冗余块使矢量数据库变得更大并减慢检索速度。常见的解决方法是余弦相似度阈值。该方法将每个块简化为单个向量,然后使用相似度分数来比较向量。但是单个向量可能会丢失区分真正的重复项和仅共享同一主题的块所需的细粒度 词元级 细节。我们提出交叉注意力校准重复数据删除(CACD)。 CACD 使用交叉编码器而不是单个池化向量来对照内存中已保留的块池检查每个新块。这样可以保留 词元级 的详细信息直至最终比较。 CACD 结合了三个部分:跨编码器比较本身、新信息分数(NIS),用于衡量已有候选者无法解释的块的数量,以及对多个候选者的多数投票,而不是单个最佳匹配。 NIS 是根据交叉编码器的注意力熵计算的。我们针对五种现有过滤方法、九种分块策略和 18 种配置测试了 CACD,所有这些都在完整的 SQuAD 1.1 验证集上进行。在我们的实验中,CACD 平均删除了 9.75% 的块。这个丢弃率接近其他语义级方法,并且远高于几乎没有删除任何内容的精确匹配过滤器。在这些实验中,CACD 处理每个配置的时间平均为 51.0 秒,比最强基线 NERExact(69.6 秒)快约 27%,比余弦相似度过滤(356.7 秒)快约 7 倍。这些结果来自单个数据集,因此我们将它们作为早期比较而不是一般性主张。基线评估和 CACD 的代码可在 https://github.com/lehuyphuong/rag_bench 和 https://github.com/lehuyphuong/cacd_dedup 获取。