论文
RAG-CT:通过扫描提示分发降低检索增强生成系统的隐私风险
RAG-CT: Mitigating Privacy Risks on Retrieval-Augmented Generation Systems via Scanning Prompt Distribution
摘要
检索增强生成(RAG)已成为一种强大的范式,通过将响应基于外部知识来提高大型语言模型(LLM)生成内容的质量,从而减少幻觉和事实错误。然而,最近的研究强调了一个严重的漏洞:对手可以利用检索过程从底层语料库中提取个人身份信息(PII)。为了减轻这种风险,我们提出了一种新颖的防御方法 RAG-CT,它通过分析恶意查询的熵和边际分布并使用基于分数的检测方法来识别恶意查询。在两个数据集上对四种最先进的攻击策略和四种防御基线进行的广泛实验表明,我们的方法显着减少了 PII 泄漏,同时优于现有的防御措施。这项工作提供了一种轻量级但有效的机制来保护 RAG 系统免受 PII 泄漏,而无需修改底层 LLM 或检索器。