论文

ForceForget:去除强化概念以增强文本到图像模型的安全性

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

模型训练模型编辑与遗忘

摘要

随着生成式人工智能的进步,文本到图像(T2I)模型具有生成各种内容的能力。然而,T2I 模型仍然会生成不安全的内容。为了缓解这个问题,提出了各种概念擦除方法。然而,现有的方法往往会过度消除不安全的概念并抑制有害提示中包含的良性概念,这会对模型的实用性产生负面影响。在本文中,我们通过强化学习优化概念擦除奖励(CER),重点关注消除不安全内容,同时保持安全语义解释的模型能力。为了避免过度的内容擦除,我们引入了安全适配器来投影部分文本嵌入,以便在交叉注意层中进行有效的概念调节。在不同数据集上进行的大量实验证明了与现有最​​先进(SOTA)概念擦除方法相比,所提出的方法在减少不安全内容生成的同时保持良性图像的高保真度的有效性。在稳健性方面,我们的方法优于红队工具的同类方法。此外,我们展示了所提出的方法在新兴的图像到图像(I2I)场景中比其他方法更有效。最后,我们扩展了我们的方法来消除一般概念,例如艺术风格和对象。免责声明:本文包含对可能冒犯某些读者的露骨色情内容的讨论。这项工作中使用的所有图像都是合成的或来自公共数据集。