论文

BLADE:LLM Unlearning 的双层低秩增强拉格朗日擦除

BLADE: Bilevel Low-rank Augmented-Lagrangian Erasure for LLM Unlearning

模型训练模型编辑与遗忘

摘要

现有的 LLM 去学习方法在鲁棒性方面存在困难:无限制的遗忘损失会降低模型的一致性,固定权重平衡无法适应训练中保留难度的变化,并且在一个基准上工作的方法在缩放或重复应用下会变得不稳定。我们提出了 BLADE,一个受约束的双层框架,其三种机制可以对优化环境进行平滑、可预测的控制:一旦词元达到足够的不确定性,其梯度恰好为零;钳位熵遗忘损失;不对称增广拉格朗日量,在任何违规行为后永久保留保护; LoRA 适配器的双层结构可以在每个遗忘步骤之前修复保留的损坏。 BLADE 在三个基准测试系列中占据主导地位,在 TOFU 上将平均综合得分提高了 6$%,在 MUSE Books 上提高了 9$%,在 KnowUndo 上提高了 7$%,并且在 MUSE News 上的 $4\times$ 缩放和 $4$ 连续遗忘步骤下保持稳定,其中最佳竞争方法完全崩溃。