论文

表示引导的参数高效 LLM 忘却

Representation-Guided Parameter-Efficient LLM Unlearning

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 经常记住敏感或有害信息,需要有效的机器遗忘技术。虽然现有的参数有效的遗忘方法已经显示出希望,但它们仍然在遗忘与保留之间进行权衡。这可以归因于他们依赖参数重要性度量来识别仅对遗忘集重要的参数,这从根本上受到叠加现象的限制。由于 LLM 参数的多语义性质,这样的重要性度量可能很难解开与遗忘集和保留集相关的参数。在这项工作中,我们提出了表示引导的低秩取消学习(REGLU),这是一种利用表示空间的几何特性来实现稳健且精确的取消学习的新颖方法。首先,我们为 LoRA 开发了一种表征引导的初始化方法,用于识别选择性遗忘的最佳子空间。其次,我们引入正则化损失,将 LoRA 更新的输出限制在保留集表示子空间的正交补中,从而最大限度地减少对保留集上模型性能的干扰。我们在多个模型的 TOFU 和 WMDP 基准上评估 REGLU。我们的结果表明,REGLU 始终优于最先进的基线,在保持更高的模型效用的同时实现了卓越的忘却质量。