论文

SAGE:最终忘却向量的保留感知事后清理

SAGE: Retain-Aware Post-Hoc Sanitization of Final Unlearning Vector

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 忘却的目的是消除不需要的知识或行为,同时保留保留的能力。当前的忘却方法都涉及忘却和保留之间的权衡。我们发现,保留激活偏差也可以用来量化忘却方法对保留造成的损害,而无需考虑忘却过程的具体实现。这使我们能够使用事后方法恢复任何遗忘方法的保留性能。因此,我们提出了一个补充性的事后设置来清理最终的更新向量,而无需重新运行原始的未学习管道。在这种情况下,我们设计了 SAGE(光谱激活-几何清理),这是一种与源无关的修正,用于最终的忘却更新。 SAGE 从小型保留代理收集真实模块输入,提取其主要激活几何形状,并以封闭形式求解源锚定优化目标,这抑制与高能保留方向对齐的更新分量,同时保留源方法的遗忘载体。在多种忘却方法、模型规模和基准中,SAGE 始终如一地缓解了保留-忘记的权衡,将最终向量的事后清理确定为机器忘却的实用且尚未充分探索的轴。