论文

训练数据提取攻击的跨语言可转移性以恢复记忆的 PII

Cross-Lingual Transferability of Training Data Extraction Attacks to Recover Memorized PII

模型评测安全与风险评测

摘要

大语言模型 (LLM) 中个人身份信息 (PII) 保护的稳健性是一个关键问题,但与跨语言数据提取相关的风险仍未得到充分探索。本研究评估了以英语为中心的多语言模型在以非英语语言提示时对训练数据提取 (TDE) 攻击的脆弱性。我们构建了一个包含社交媒体句柄、电子邮件地址和电话号码的多域 PII 数据集,并将攻击上下文翻译为意大利语、西班牙语、法语和德语。我们的结果表明,针对以英语为中心的模型和多语言模型的 TDE 攻击都会转移到不同的语言:即使在训练之前的数据中可能只包含原始英语提示,但攻击在翻译的提示上是成功的。对翻译样本的网络存在检查确认它们无法在线获取。用其他语言恢复的英语泄漏的比例随着模型的多语言能力而增长,而当原始措辞丢失时,即使没有改变语言,它也会急剧下降。这表明训练之前的本地多语言促进了潜在跨语言桥梁的出现,从而简化了个人身份信息 (PII) 的检索。我们分析了多语言大语言模型 (LLM) 的激活,发现同一提示的不同翻译以相似的表示形式桥接,中间层的对齐最强。我们的结果凸显了现代LLM中的基本安全漏洞,需要更强大的、与语言无关的清理策略来实现未来的模型对齐。

训练数据提取攻击的跨语言可转移性以恢复记忆的 PII的原论文方法或结果图
图 1:与严格攻击泄漏计数相比,释义攻击下泄露的 PII 实例的保留情况,对四种多语言模型(Llama 3.2 1B/3B、Qwen2.5 3B/7B)和三种以英语为中心的模型(GPT-J 6B、GPT-Neo 1.3B/2.7B)进行平均