论文

TRIS:防止知识中毒的三层检索完整性筛选

TRIS: A Tri-Layer Retrieval Integrity Sieve Against Knowledge Poisoning

上下文与知识检索增强

摘要

检索增强生成 (RAG) 将 大语言模型 置于外部语料库中,但对检索到的文档的隐式信任创建了一个关键的攻击面:PoisonedRAG 表明,少数精心设计的段落可以主导密集检索,并引导生成转向攻击者选择的答案。我们提出了三层筛子,这是一种中间件防御,它通过具有独立判断模型的跨嵌入空间聚类、触发有效负载工件的结构过滤以及 LLM 一致性验证来清理检索到的证据。该设计利用了检索阶段中毒的一个关键弱点:单个文档必须满足一种嵌入几何结构、一种内部触发有效负载结构和一个生成目标——很少同时满足这三个目标,这一脆弱性即使针对围绕它进行解释的自适应攻击者也仍然存在。在 Natural Questions、HotpotQA 和带有 Contriever 检索的 MS-MARCO (k=50) 上,Sieve 将黑盒攻击成功率从 67.0/87.0/64.0% 降低到 3.0/14.0/4.0%,在启用第 3 层的 NQ 上将白盒 HotFlip 攻击从 ~74% 减轻到 27.8%,并将中毒文档 MRR 提高到 0.000,同时将干净的准确率从受到攻击的 13-33% 恢复到 58-76%。在具有架构意识的对手的攻击下,他们解释触发器来逃避结构过滤器,使一致性层将自适应 ASR 减半(在 NQ 上从 32.0% 降至 15.0%),同时将干净准确度提高 18 个点,在实时检索下增加了大约 16-19 秒/查询的延迟。