论文
无附带损害的擦除:扩散模型中的精确概念去除
Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models
摘要
无需训练 概念擦除是控制文本到图像扩散模型的一种有吸引力的机制,但精确擦除通常以破坏语义相关的非目标概念为代价。现有的值空间方法沿着目标概念方向去除每个交叉注意力值的分量,隐式地将目标身份和共享视觉结构视为相同的信号。我们认为,这是先前保存中大部分附带损害的根源。我们引入了 CARE,一种封闭形式的概念擦除算子,它将原始目标方向替换为根据一小部分保留的概念锚计算出的保持子空间感知方向。得到的编辑直接应用于交叉注意值空间,不需要模型 微调,并且仅添加可忽略不计的离线计算。单个收缩参数控制擦除与保留的权衡。我们进一步表明,算子承认最小干扰解释,并且以其投影形式保持子空间不变。标准概念擦除协议下的实验表明,我们的方法更忠实地保留非目标概念,同时保持跨实例、风格和名人概念的竞争性擦除。代码:https://github.com/parthupman/care