论文
RAG-NAROK:基于来源特定驳斥的 RAG 检索感知知识库投毒
RAG-NAROK: Retrieval-Aware Knowledge Corpus Poisoning in RAG with Source-specific Refutation
摘要
检索增强生成(RAG)系统已成为把大语言模型(LLM)输出锚定于可验证外部知识的主流架构,但其对动态检索流水线的结构性依赖引入了一类很大程度上未被探索的对抗脆弱性。现有知识库投毒攻击本质上是静态的:对抗文档被预先计算并注入,而不感知受害系统对给定查询实际会检索到什么,使攻击对其载荷在生成器上下文窗口周围的竞争性文档环境视而不见。与这种对检索上下文视而不见的传统静态投毒不同,我们提出 RAG-NAROK(Retrieval-Anchored Generation Negation And Response Quality Collapse),一个适应查询文本的 RAG 攻击框架。RAG-NAROK 利用 RAG 流水线固有的透明性:先提取合法来源身份,再生成锚定特定来源的驳斥(Anchor-Specific Refutation)文档,明确点名并贬损被检索来源,同时利用时效性与权威性偏差把文本生成引向目标答案。结果表明,RAG-NAROK 在多个领域显著优于静态基线,揭示了 RAG 透明性与 AI 安全之间的根本张力。
