论文

GROM:无梯度快速一次性机器忘却

GROM: Gradient-Free Rapid One-Shot Machine Unlearning

模型训练模型编辑与遗忘

摘要

机器遗忘已成为从 大语言模型 (LLM) 中安全删除特定敏感知识的关键能力。当前最先进的方法主要依赖于通过 微调 进行迭代、训练时遗忘。然而,即使使用 LoRA 等参数高效的降维技术,基于梯度的优化在计算上仍然昂贵并且缺乏明确的分析公式。它还可以使目标知识仅仅被隐藏而不是被删除,以至于简单地量化未学习的模型就可以恢复它应该删除的大部分内容。为了解决这个问题,我们提出了一种新颖的一次性消除学习方法,放弃迭代优化,转而采用直接、精确的分析解决方案。我们将遗忘过程构建为岭正则化最小二乘优化问题,导出目标权重矩阵的封闭式加性更新。此更新强制选定的图层抑制不需要的内容,同时严格保留其对保留数据的行为。 GROM 仅通过无梯度前向传递进行计算,无需反向传播,也无需迭代收敛,只需几秒钟即可应用权重编辑,这使其比传统的 微调 快几个数量级。广泛的评估表明,GROM 在 TOFU-5%、TOFU-10%、MUSE-Books、MUSE-News 和 WMDP 上实现了最先进的遗忘效用权衡,从而在不牺牲整体模型性能的情况下显着减少了计算开销。由于更新从权重中删除了目标内容而不是屏蔽它,因此 GROM 还可以承受低位量化攻击,从而恢复基于梯度的基线似乎忘记的大部分内容。我们的代码可在 https://github.com/Batorskq/GROM 上公开获取。