论文
TRAP:理解和减轻语言模型中的隐私记忆
TRAP: Understanding and Mitigating Privacy Memorization in Language Models
摘要
在敏感记录上微调语言模型可以使其能够重现它们。我们询问这种记忆何时出现以及如何在事先不知道哪些跨度敏感的情况下防止它。我们的出发点是,大多数记忆分数和攻击都有一个统计核心:模型是否比某些参考分配更大的概率分配词元。将在同一语料库的互补部分上训练的模型作为参考,给出目标参考优势(TRA),这是一个每个标记的信号,它将模型适合特定记录的内容与它在记录中学到的内容分开,并且成本低廉且可区分。然后,我们研究微调期间驱动记忆的因素:它不断增长,远远超过验证最小值,在小数据集和更高的学习率下更大,当基础任务更困难时,它会更高。早期停止消除了其中的大部分内容,但由于它是通过聚合验证损失来选择的,因此对于嵌入在其他可学习文本中的罕见的、难以预测的跨度(这正是敏感信息往往如此)的帮助最小。因此,我们引入了 TRAP,这是对 tokenwise TRA 的一种单方面惩罚,仅在目标模型领先于其参考的情况下起作用。在带有注释的个人信息的学生论文和带有患者标识符的临床案例中,TRAP 以很少的效用成本使记忆接近未经训练的模型的水平,其中通用正则化器几乎不移动,并且差异隐私放弃了大部分微调所购买的东西。