论文

GRACE:扩散模型中几何引导保留的自适应概念擦除

GRACE: Adaptive Concept Erasure with Geometry-Guided Retention in Diffusion Models

模型训练模型编辑与遗忘

摘要

文本到图像(T2I)扩散模型不可避免地会从大规模预训练数据中内化敏感或不合规的概念,从而需要事后概念擦除。然而,现有的擦除方法往往缺乏对参数更新的明确约束,导致过度干预和意外的语义漂移。此外,许多方法依赖于手动设计的反事实监督,例如代理提示,这会产生大量的数据构建成本,从而限制了新概念的可扩展性。为了解决这些限制,我们提出了 GRACE,这是一种结构化的概念擦除框架,旨在实现局部和选择性干预。具体来说,我们引入了语义加权的敏感子空间估计来精确锁定干预方向,并采用轻量级子空间约束适配器来防止全局语义干扰。为了消除对手动提示工程的依赖,我们设计了一种自动解耦的安全锚机制。为了减轻过度干预引起的语义漂移,我们引入了一种能量驱动的动态门控机制,可以自适应地控制推理时干预的时间和强度。大量的实验表明,我们的方法在擦除有效性和生成保真度之间实现了卓越的平衡。与五种最先进(SOTA)概念擦除方法的平均性能相比,我们的方法将细粒度 NSFW 减少率提高了 17.86\%$,同时将宏观平均目标 CLIP 得分和面向保存的 Fréchet 起始距离(FID)分别降低了 $4.75\%$ 和 $50.58\%$,表明概念抑制更强,原始模型生成效用的保留得到了显着提高。