论文

TopoGuard:基于图论的 RAG 分裂知识攻击防御

TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG

AI 基础设施AI安全与内容治理基础设施

摘要

生产检索增强生成 (RAG) 系统依靠聚合多个外部文档来回答复杂的查询。然而,检索到的文档引入了新的威胁面,可用于发起分裂知识攻击。在这种攻击中,攻击者注入的文档单独来说是良性的,但在组合并输入到语言模型时会产生错误的关联。本文表明,新的攻击在结构上对于现有的每文档过滤器(例如 LlamaGuard)来说是不可见的。为了解决 RAG 中的这个问题,这项工作引入了 TopoGuard,这是一系列基于图论的方法,通过从检索到的文档构建语义相似性图并检测具有恶意拓扑的上下文,专门针对知识分割攻击。基于理论分析,TopoGuard 系列已被证明即使在有噪声输入的情况下也有效且稳健。对两个检索数​​据集进行了广泛的实验,并与多种基线方法进行了比较。具体来说,在 HotpotQA 数据集上,TopoGuard-$λ_2$+Entity 在 1\% FPR(召回率 32.6\% vs 1.5\%)下比 LlamaGuard-2-8B 多捕获 21$\times$ 的攻击。与使用 大语言模型 的生产 RAG 检测系统相比,所提出的 TopoGuard 变体以亚毫秒延迟有效运行,并在自适应对手和良性跨域查询下保持鲁棒性。