论文

在记忆与泛化范围内学习控制遗忘

How Learning Governs Unlearning across the Memorization-Generalization Spectrum

模型训练模型编辑与遗忘

摘要

虽然 遗忘 试图消除通过学习获得的不需要的能力,但很少有研究探讨模型的学习方式如何塑造其后续的 遗忘。在本文中,我们从记忆和泛化的角度研究了这种联系,这是模型在训练过程中采用的两种最具代表性但又相互竞争的策略。我们首先使用模加法中的 grokking 对记忆型和泛化型模型进行分类,并将它们的响应与 遗忘 进行比较,表明后者遭受更大的保留损害,即保留集上的性能下降更大。此外,我们通过引入分桶模块化加法进行更细粒度的分析,其中可以在记忆泛化范围内明确控制两种策略各自的贡献。在这种设置中,我们重申相同的趋势持续存在并且几乎是单调的。我们进一步证明这种关系在逐字和实际 召回率 设置中也适用于 LLM 遗忘。最后,我们提供了两个开发更好的 遗忘 方法的实用见解,强调了 遗忘 中学习动态的重要性。

在记忆与泛化范围内学习控制遗忘:论文原图
图 1:遗忘 在记忆-泛化范围内的分析。我们认为,遗忘 中的保留损伤会随着模型在训练期间对泛化的依赖而不是记忆而增加。我们分三个步骤进行研究:对比通过 grokking 分开的记忆和泛化模型(§3),将这种对比扩展到整个频谱的细粒度分析,通过记忆底数进行量化(§4),并确认 LLM 遗忘 中的关系(§5)。