论文
ProGRank:以探针梯度重排防御稠密检索器 RAG 的语料库投毒
ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning
摘要
检索增强生成(RAG)通过将生成基于检索到的证据来提高大语言模型应用程序的可靠性,但它也引入了一个新的攻击面:语料库中毒。在此设置中,攻击者会注入或编辑段落,以便将它们排名到目标查询的 Top-$K$ 结果中,然后影响下游生成。现有的语料库中毒防御措施通常依赖于内容过滤、辅助模型或生成器端推理,这可能会使部署更加困难。我们提出了 ProGRank,这是一种针对密集猎犬 RAG 的事后、免训练的猎犬侧防御。 ProGRank 在轻度随机扰动下对每个查询-段落对进行压力测试,并从检索器的一个小的固定参数子集中提取探针梯度。从这些信号中,它得出两个不稳定信号:表征一致性和分散风险,并将它们与重新排名步骤中的得分门结合起来。 ProGRank 保留原始段落内容,无需重新训练,并且当部署的检索器不可用时还支持基于代理的变体。跨三个数据集、三个密集检索器主干、代表性语料库中毒攻击以及检索阶段和端到端设置的大量实验表明,ProGRank 提供了更强的防御性能和有利的鲁棒性-实用性权衡。它在自适应规避攻击下也保持竞争力。
