论文
通过门控激活重定向进行推理时间机器的忘却
Inference-Time Machine Unlearning via Gated Activation Redirection
摘要
大语言模型 会记住大量的训练数据,引发人们对隐私、版权侵权和安全的担忧。机器去学习旨在消除目标忘记集的影响,同时保留模型性能,理想地近似从头开始重新训练的模型,而无需忘记集。现有方法旨在通过基于梯度的方法更新模型参数来实现这一目标。然而,这些更新的计算成本很高,会导致不可逆的权重变化,并且在模型量化部署时性能会下降。最近改变模型权重的替代方法是激活工程,其中在推理过程中改变激活以引导模型行为。尽管规避了权重编辑,但朴素激活引导引入了自己的故障模式,因为单个全局引导向量对每个输入应用相同的干预,导致模型行为发生意外变化。我们引入了通过门控激活重定向进行推理时遗忘(GUARD-IT),这是一种无训练和梯度的方法,可在推理时通过依赖于输入的激活转向进行遗忘。由此产生的干预被应用为残差流中的范数保持旋转,使模型权重保持不变。 TOFU 和 MUSE 上的实验表明,GUARD-IT 在三个模型尺度上匹配或超过了 12 个基于梯度的基线,同时是在所有设置中同时保持效用、抑制记忆和避免灾难性崩溃的唯一方法。 GUARD-IT 进一步支持持续忘却而无需重新训练,并且在量化(参数编辑方法退化的情况)下仍然有效。