论文

TEA:文本编码器对齐,用于文本到图像模型中的稳健概念擦除

TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models

模型训练模型编辑与遗忘

摘要

文本到图像的扩散模型可能被滥用,通过绕过内置安全机制的对抗性或释义提示来生成有害内容。现有的概念擦除方法通常面临对抗性提示的鲁棒性有限、良性生成质量下降或依赖于引入持续计算开销的推理时间干预。为了解决这些限制,我们将概念擦除表述为文本表示空间中的域对齐问题。我们提出了一种轻量级文本编码器对齐框架(TEA),该框架仅微调文本编码器,同时保持生成主干完全冻结。给定概念-锚点提示对,我们的方法训练鉴别器来区分包含概念的提示的 词元级 表示与安全锚点提示的表示,同时更新文本编码器以使这些表示无法区分。 TEA 引入了零推理时间开销,并且仅需要少量的 微调 步骤,使其大规模部署非常高效。尽管效率如此高,TEA 还是在 Stable Diffusion v1.4 上实现了最先进的针对黑盒和白盒对抗性攻击的擦除鲁棒性,同时保持了良性提示的生成质量。此外,TEA 与模型无关,并且在 Stable Diffusion v3.5 上实现了最低的攻击成功率,将概念擦除扩展到具有 T5 调节的整流流 Transformer 架构,而先前的方法在很大程度上尚未探索。代码可在 \href{https://github.com/alirezafarashah/TEA.git}{https://github.com/alirezafarashah/TEA.git} 获取