论文

面向定向且鲁棒概念遗忘的选择性微调

Selective Fine-Tuning for Targeted and Robust Concept Unlearning

模型训练模型编辑与遗忘

摘要

文本引导扩散模型被数百万用户使用,但很容易被滥用来生成有害内容。概念遗忘方法旨在降低模型生成有害内容的可能性。传统上,这一直在单个概念层面进行处理,只有少数近期工作考虑了更现实的概念组合。然而,最先进方法依赖全量微调,计算代价高昂。概念定位方法可促进选择性微调,但现有技术是静态的,导致效用欠佳。为应对这些挑战,我们提出TRUST(定向鲁棒选择性微调),一种动态估计目标概念神经元并通过选择性微调对其执行遗忘的新方法,并借助基于Hessian的正则化。我们在与多个SOTA基线的对比实验中表明,TRUST对对抗性提示具有鲁棒性,能在相当程度上保持生成质量,并且显著快于SOTA。我们的方法无需任何特定正则化,即可实现不仅对单个概念、还包括概念组合与条件概念的遗忘。

面向定向且鲁棒概念遗忘的选择性微调
图2:TRuST 概览:左侧流程展示了概念神经元的发现以及同时使用 CSR 与 CIP 的选择性微调。右半部分展示了 TRuST 遗忘概念组合与条件概念的能力,并展示了在对抗性提示(P4D(Chin et al., 2024))下进行“Nudity”遗忘时与成熟概念擦除方法的比较。带“*”的图像部分出于安全考虑已被有意隐藏。