论文

英文源多语言 RAG 中的隐私风险所在:跨五种查询语言的阶段分解审计

Where Privacy Risk Lives in English-Source Multilingual RAG: A Stage-Decomposed Audit Across Five Query Languages

模型评测安全与风险评测

摘要

一个常见的假设是,切换到非英语语言会使多语言 RAG 系统更容易受到个人信息攻击。我们在具有五种查询语言和两阶段防御(LLM 输入判断 + 正则表达式输出过滤器)的英语源合成 PII 语料库上进行了测试,其翻译器、判断器、反向翻译器和生成器都是 Qwen2.5-7B 的管道 - 因此下面的每个发现都是管道条件的,而不是语言固有风险的因果排名。在仅输出过滤下,英语具有最高的观察到的非结构化 PII 泄漏率;在文档级引导间隔下,只有英语与斯瓦希里语能够清晰地分开。添加输入判断后,阿拉伯语和斯瓦希里语仍然存在残余泄漏,并且反向翻译查询并不能缩小差距(我们报告了一种消融,但不能用作因果诊断,因为反向翻译器也是 Qwen)。在单独的 n=17 多语言提示判断残差角上,将标准语料文档附加到输入判断块 15/17 残差单元。我们将最后一个结果视为一种机制诊断,而不是可部署的防御:它使用预言机检索,仅在对抗性查询上测量阻止/允许率,并且我们不测量良性查询误报率,也没有答案效用成本。补充材料包含代码、语料库、查询和预试验 JSONL;优先级后续是独立 MT 加非 Qwen 判断复制,带有母语查询集,范围在“限制”部分。