论文

只忘记重要的事情:层选择性忘记学习以实现稳健的 LLM

Forgetting Only What Matters: Layer-Selective Unlearning toward Robust LLMs

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 可以记住和复制敏感、受版权保护或其他不良训练内容,从而产生隐私、安全和监管问题。机器忘却为完全重新训练提供了一种实用的替代方案,但许多现有方法应用广泛或固定的参数更新,这可能会降低实用性,并且在 后训练 量化等部署变化下仍然很脆弱,其中被遗忘的知识可能会部分重新出现。我们提出通过遗忘层仅忘记重要的内容(FOM-UL),这是一个层级遗忘框架,它使用忘记保留显着性分数来选择 Transformer 层。该分数标识了对遗忘集影响较大且对保留集影响较低的层,从而允许 FOM-UL 将更新集中在最有效的地方,同时保持模型的大部分不变。这种有针对性的更新策略改善了遗忘与效用的权衡,并通过减少小而分散的更新被低位舍入擦除的机会,提供了通往量化弹性遗忘的经验路径。在 TOFU、KnowUnDo 和 MUSE 式评估中,与基于 GA、NPO、KLD、SURE、ReLearn 和 LUNAR 的强大基线相比,FOM-UL 减少了残余记忆,同时保留了接近普通模型的保留集效用。在 8 位和 4 位 后训练 量化下,FOM-UL 比竞争方法保持更强的记忆抑制和效用保留,并且对抗性提示评估显示遗忘内容的恢复率较低。总体而言,FOM-UL 提供了一种有效的遗忘策略,可以改善有针对性的遗忘、效用保存和部署稳健性,而无需正式保证擦除。