论文

SAUL:锐度感知增强拉格朗日遗忘

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 中的机器取消学习面临着擦除目标知识和保留通用效用之间的关键权衡。我们提出了SAUL(Sharpness-Aware Augmented-Lagrangian Unlearning),它将遗忘表述为遵循“忘记足够多,但不超过必要”原则的约束最小化问题。 SAUL 的核心是将遗忘制定为具有指定满足标准的显式约束,而先前的遗忘方法通常通过优化目标隐式指定所需的遗忘水平。增强拉格朗日控制器根据约束违规自适应地调整遗忘侧压力,并最终在满足规定标准时停用遗忘侧更新。对保留和遗忘目标的锐度感知更新,以及维持角色分离状态的双优化器设计,进一步稳定了由此产生的遗忘动态。我们在 TOFU、WMDP 和 MUSE 基准上评估 SAUL,在特定基准的遗忘标准下,展示了相对于代表性锐度和基于扰动的基线的有利的遗忘效用权衡。除了完整的 SAUL 框架之外,我们在 TOFU 上进一步表明,应用增强拉格朗日控制器作为代表性基线的插入修饰符可以提高其遗忘后效用,从而证明显式遗忘控制的实用价值。