论文
论大语言模型中隐私信息遗忘的可恢复性
On the Recoverability of Private Information Unlearning in Large Language Models
摘要
大语言模型 (LLM) 可以记住敏感信息,引发严重的隐私问题。机器取消学习提供了删除此类信息的潜在解决方案,但目前尚不清楚现有方法是否真正删除它或只是将其隐藏在模型中。一个关键的挑战是在统一的评估框架下量化敏感数据的持久性。为了解决这个问题,我们构建了一个包含虚假私人信息的合成数据集,并提出了一个白盒审计框架来系统地评估声称遗忘的信息是否被真正删除。使用这个框架,我们评估了五种现有的遗忘方法,并发现简单的“逆贪婪”解码(在每一步选择最不可能的标记)可以恢复据称被遗忘的私人信息。我们的结果表明,当前的遗忘方法通常无法完全消除敏感信息,这凸显了需要更可靠的方法来确保部署的 LLM 中的隐私。