论文

忘却不仅仅是擦除:通过代际不平等实现时间脱钩

Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 需要有效的遗忘来解决隐私法规和安全问题。然而,在不影响通用性的情况下实现精确遗忘仍然具有挑战性。现有的序列和 词元级 方法会惩罚目标输出,而不对其上下文相关的检索路径进行建模,这可能会破坏语言结构或抑制良性知识。我们提出了 ADU,一个细粒度的、基于训练的框架,它将遗忘从词元擦除转变为上下文注意力路径解耦。利用局部和全局注意力头之间的功能区别,ADU 识别预计划位置,以检索持久敏感锚点并在原始模型下修复其候选路径。然后,它训练注意力投射适配器来抑制这些路径上的注意力质量,同时保留局部注意力结构和保留集语言模型。 后训练激活交换测试修改后的注意输出模块是否传递学习到的遗忘效应。 ADU 在 TOFU 和 WMDP 基准的评估基线中实现了最强的总体性能,包括 TOFU 的忘记质量 (0.93)。它保留了 87--98% 的模型效用(平均为 92.9%,基线为 81.9%),同时减少了良性环境中的副作用。