论文
RASteer:用于扩散模型中概念擦除的保留感知激活转向
RASteer: Retain-Aware Activation Steering for Concept Erasure in Diffusion Models
摘要
概念擦除旨在从预训练的文本到图像扩散模型中删除目标概念,例如受版权保护的样式、可识别的字符或不安全的内容,同时保留其生成其他内容的能力。现有的激活引导方法主要从目标概念构建擦除方向,并在推理时沿着该方向调整模型激活。然而,目标概念和保留概念通常在模型的表示空间中重叠,因此该方向还包含保留概念所依赖的共享组件。因此,直接沿着这个方向引导可能会抑制保留的概念并损害非目标内容的生成。为了解决这个问题,我们提出了保留感知激活转向(RASteer),这是一种免训练的方法。 RASteer 首先根据要保留的概念构建保留子空间。然后,保留正交转向 (ROS) 会从擦除方向删除与该子空间对齐的组件,从而使转向更加针对目标。由于完全删除共享组件会削弱擦除能力,因此我们进一步引入了重叠自适应校准(OAC)。在每一层和去噪步骤中,OAC 使用擦除方向和保留子空间之间的重叠来控制每个共享组件被删除的量,从而平衡目标擦除和概念保留。跨多个主干和基准的不安全内容、实例和艺术风格擦除的实验表明,RASteer 匹配或优于我们评估的激活引导和权重编辑基线,在擦除和保留之间实现了更好的平衡。