论文

RAGuard:针对数据中毒的检索增强生成系统的分层防御框架

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

上下文与知识检索增强

摘要

检索增强生成(RAG)系统将 大语言模型 (LLM)置于外部语料库中,但这种依赖使它们面临语料库中毒:恶意注入操纵检索到的证据的段落。我们引入了 RAGuard,这是一种针对 RAG 管道上 \emph{factual} 语料库中毒攻击的分层防御。第一层在合成有毒文档(捏造的事实、矛盾和推理陷阱)上对密集的 检索器 进行对抗性微调,教导它在生成之前降低恶意段落的排名。第二层,零知识推理补丁 ZKIP,是一个无标签的黑盒过滤器:对于每个检索到的文档,它执行留一解码,并通过其删除引起的语义偏移和输出熵变化对文档进行评分。 ZKIP 不需要毒标签,不需要 真值 答案,也无法访问模型内​​部结构;它在反事实背景下比较模型自己的答案。在中毒率为 5--30\% 的中毒自然问题上,对抗性 检索器 训练单独减少但不会消除攻击成功率,而 ZKIP 在每个防御配置中将测量的攻击成功率提高到 0.000,使 Recall@5 保持在干净语料库基线的 0.03 以内。对 Natural Questions 和 BEIR (NFCorpus) 的监督分析证实,ZKIP 依赖​​于携带可学习毒物结构的反事实信号。每个查询的防御成本为 $k{+}1$ 生成器传递($k{=}5$ 为 $6\times$);我们分析了批处理和提前停止的近似值,以减少这种开销。我们还表明,保留关键字的毒药使词汇 检索器(例如 BM25)基本上不受影响,这一观察结果描绘了威胁模型的边界。发布代码、数据集和评估工具以实现可重复性。