论文
纪律扩散:针对 NSFW 一代的文本到图像扩散模型
Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation
摘要
文本到图像 (T2I) 扩散模型能够根据文本提示构建高质量的图片,但它们会带来安全问题,因为在提供有害输入时,它们可能会生成令人反感或令人不安的图像。现有的安全过滤器通常依赖于基于文本的分类器或基于图像的检查器,它们在检测到威胁时完全阻止输出,向用户发出明确的允许/阻止反馈信号。这种二元策略使模型容易受到对抗性攻击,这些攻击会改变关键字以绕过检测,并且会导致高误报率,从而降低良性用户的体验。为了解决此类漏洞,我们提出了纪律扩散(DDiffusion),这是一种新颖的稳健的文本到图像扩散,通过发现提示嵌入中隐含的恶意语义来对抗不安全工作(NSFW)的生成。 DDiffusion 利用语义检索机制来根据概念分布评估提示,而不是依赖于脆弱的成对相似性。此外,它在扩散过程中采用定位方法,有选择地仅编辑生成图像的有害区域。通过返回本地清理的图像而不是应用统一阻止,DDiffusion 可以抑制恶意内容,同时保留良性提示的生成保真度,并避免现有探测攻击所依赖的二进制允许-拒绝信号。