擦除或不擦除:具有保护意识的自适应排序子空间扩展的鲁棒 无需训练 概念擦除
To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
摘要
概念擦除技术 (CET) 编辑文本到图像的扩散模型,以擦除不需要的目标,例如 NSFW 内容或受版权保护的样式,同时保留良性概念的模型实用性。当前的 CET 面临着擦除稳健性和实用性之间的权衡:更强的编辑更可靠地擦除目标,但会降低非目标概念的实用性,反之亦然。这源于现有方法如何定义要删除的内容和要保留的内容。许多 CET 依赖于手动指定、由 LLM 生成或由 CLIP 图文相似度选择的静态概念库。此类银行不会模拟提示在去噪过程中如何引导模型,使其容易受到重新引入目标同时抑制附近良性概念的触发器的影响。我们提出了保护感知自适应排序子空间扩展(PARSE),这是一个 无需训练 框架,用于在潜在扩散模型中进行稳健的概念擦除。给定一个目标,PARSE 使用无分类器指导查询扩散模型,以动态发现模型词汇中的目标诱导擦除概念和附近的保留概念。然后,它使用保留感知投影来编辑交叉注意力值空间,该投影会删除目标方向,同时保持保留方向不变。对于超出此词汇索引空间的触发器,PARSE 通过文本反转迭代搜索重新出现的触发器,并仅当新的触发器方向不与保留语义冲突时才自适应地扩展已擦除的子空间。我们还引入了平衡擦除效用评分(BEUS),它通过有界单调变换和调和平均聚合将鲁棒性(多次攻击下的 ASR)和效用保留(FID)结合起来。对 NSFW、艺术风格和对象擦除的实验,以及对许多 CET 基线的大规模稳健性实用性分析,表明 PARSE 可以稳健地擦除多个概念,而不会牺牲后期编辑实用性。