论文

通过边际自我修正大规模快速忘却

Fast Unlearning at Scale via Margin Self-Correction

模型训练模型编辑与遗忘

摘要

语言模型取消学习更新了经过训练的模型,使其表现得好像没有看到选定的训练示例一样,同时保留实用性并避免昂贵的重新训练。现有方法通常使用固定的训练预算来微调预训练模型,然后通过评估下游验证数据上保存的几个检查点来选择最终模型。不必要的计算有两个来源限制了可扩展性:训练超出了预期的忘记-保留权衡,以及需要额外存储和重复评估的检查点选择。为了解决这些限制,我们引入了 MArgin 自校正(MASC),这是一种有效的忘却方法,具有不需要下游评估的在线停止规则。给定要忘记的文本序列,MASC 会主动减少原始下一个标记与最可能的替代标记之间的 logits 差距。一旦在所有遗忘序列中足够大比例的标记位置上平均差距很小,它就会输出最终模型。在 TOFU、MUSE News 和 MUSE Books 上,MASC 以现有基线计算成本的一小部分实现了有竞争力的遗忘-保留权衡。我们进一步观察到,当我们增加模型大小(也称为参数数量)时,MASC 和 SimNPO 的权衡都会改善——遗忘指标保持可比性,同时保持效用增加。