论文

RAGSive:检索增强生成中知识毒物检测的自参考局部对比

RAGSieve: Self-Referenced Local Contrast for Knowledge-Poison Detection in Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成使用外部语料库作为推理时证据,允许攻击者通过注入少量文档来推广错误答案。检测必须在不知道目标查询或文档的情况下将这种操纵与普通相关性区分开来。现有的检测器使用文本不规则性、候选共识或语料库级图结构,其可靠性随攻击和本地上下文而变化。我们提出了 RAGSive,它构建了与每个​​检测范围相匹配的参考。在查询时,RAGSieve-Query (RSQ) 将生成候选者与同一检索的较低排名尾部进行比较,暴露答案词元集中度和载体有效负载接缝。在语料库时,RAGSieve-Graph (RSG) 将每个文档最强的语义关系与其自己的邻域层进行比较,以测量协调密度。两者都不需要有毒标签、可信语料库或训练。在三个 QA 数据集、三个密集的 检索器 和六个中毒结构中,RSQ 达到 95.2% AUROC,并在 5% 的干净移除预算下检测到 82.2% 的中毒,而最强查询时间基线的检测结果为 81.1% 和 52.5%; RSG 达到 93.3% 和 79.8%,最强语料库时间基线分别为 79.4% 和 37.6%,伪装注射的检测率分别为 79.6% 和 1.4%。联合部署将攻击成功率从 67.4% 降低到 16.1%,同时将未中毒检索 F1 保留在 41.0%,而没有过滤的情况下为 42.1%。源代码可在 https://github.com/XrazyMee/RAGSieve 获取。