论文

没有概念可以逃脱审核:具有审核意识的遗忘可在扩散模型中实现可验证的概念擦除

No Concept Escapes the Audit: Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models

模型训练模型编辑与遗忘

摘要

文本到图像的扩散模型可以生成禁止的内容,从而通过机器遗忘激发概念擦除。大多数擦除方法通过提示修改或对文本调节权重进行本地化更新来干预文本界面,并根据模型针对给定提示的输出来评估它们。这样的评估无法看到网络仍然编码的内容。潜在空间审计直接绕过文本调节和探针去噪网络,表明被删除的概念仍然可以从内部表示中恢复。我们发现这也适用于针对对抗性提示而构建的鲁棒方法,并且问题随着被删除概念的数量而增加。我们提出了用于扩散模型(AVCE)中可验证概念擦除的审计感知遗忘,这是一个基于模型潜在表示中的擦除的框架。 AVCE 审核每个概念的嵌入邻域,并将发现的脆弱方向压缩为最弱几何点处的锚点。它在此锚点处以封闭形式编辑交叉注意力和自注意力投影,然后使用路径级审计损失微调两条路径,使用正交梯度投影来巩固多个概念。在 SD v1.5、SDXL 和 Flux 1.0 上跨对象、显式内容和艺术风格遗忘进行的实验表明,与最强基线相比,AVCE 将攻击成功率降低了 5.07 倍,并将审核分数提高了 3.84 倍,同时保持了有竞争力的生成质量。

没有概念可以逃脱审核:具有审核意识的遗忘可在扩散模型中实现可验证的概念擦除的原论文方法或结果图
图 2:AVCE 框架概述。可验证漏洞锚点是通过审核嵌入空间中最薄弱的几何点来获得的。分析编辑通过语义调制器重写交叉注意力,并通过视觉定位器缩小自注意力。审计引导细化通过路径级微调和多概念梯度整合来消除残余泄漏。