论文

擦除,但并未消失:输出遗忘并不是真正的遗忘

Erased, but Not Gone: Output Forgetting Is Not True Forgetting

模型训练模型编辑与遗忘

摘要

机器遗忘(MU)通常通过输出遗忘来判断,例如低遗忘集精度或降低的 logits 级成员推理。但是,如果输出水平的成功可以与表示空间中再训练不一致的残差共存,那么当前的评估实际上证明了什么样的遗忘?我们通过再训练一致表示遗忘来研究这个问题,使用再训练模型(即在没有遗忘数据的情况下从头开始训练)作为正确遗忘的操作参考。在多种忘却方法、数据集和模型中,我们的理论分析和实证结果表明,标准的产出水平评估可能会系统性地高估忘却的成功。在这个更强的镜头下,当前的方法经常在输出层被遗忘,同时表现出相对于再训练的结构不匹配。它们部分地与遗忘样本上的再训练保持一致,在保留样本上保持更加不一致,并且使残余差异集中在与再训练相关的方向上,而不是在表示空间中扩散。这种结构性失配的特点是遗忘/保留不对称、方向失配以及沿再训练相关方向的集中残差。这些结果表明,当前的 MU 通常是针对明显的遗忘而不是再训练一致的遗忘进行评估。更广泛地说,再训练揭示了输出遗忘隐藏的内容。