论文
SHRED:通过带有 logits 降级的自我 蒸馏 保留设置自由取消学习
SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion
摘要
大语言模型 (LLM) 的机器取消学习旨在有选择地删除记忆的内容,例如私人数据、受版权保护的文本或危险知识,而无需昂贵的全面重新训练。大多数现有方法需要保留一组精选示例,以防止通用模型实用性发生灾难性退化,从而产生额外的数据依赖性,从而使部署变得复杂。我们提出了 SHRED(Self-蒸馏 via High-surprisal-only Retain-set-free Entropy Demotion),这是一种基于关键洞察的无保留集遗忘方法:并非遗忘集实例中的所有词元都平等地携带记忆信息。高信息标记集中了模型记忆的知识,而低信息标记反映了一般语言能力。 SHRED 分两个阶段运行。 (1)选择:我们对遗忘集实例进行前向传递,收集每个标记的自回归概率,并选择底部(最低概率,最高香农信息)作为遗忘位置;其余位置保留为良性锚点。 (2) 训练:我们构建修改后的 KL 目标,在遗忘位置降低记忆标记的 logits,同时保留良性位置的原始分布。然后通过单个顶级 KL 自 蒸馏 目标对模型进行训练,该目标同时驱动遗忘和效用保存。我们通过四个标准的遗忘基准评估了 SHRED,并证明它在遗忘功效和模型效用之间建立了新的帕累托最优权衡,优于依赖于保留集的方法。我们的分析表明,SHRED 对于重新学习攻击和成员推理攻击具有很强的鲁棒性,即使在多次连续的取消学习运行之后,它也能保持稳定的效用。