论文
其中包含哪些概念?检测和抑制传播中的危险内容 Transformer
What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers
摘要
文本到图像 (T2I) 模型的兴起越来越引起人们对风险内容生成的担忧,例如性、暴力和受版权保护的图像,这凸显了模型本身需要有效的保障措施。尽管已经提出了现有方法来消除 T2I 模型中的风险概念,但它们主要是为早期的 U-Net 架构开发的,使得最先进的基于 Diffusion-Transformer 的 T2I 模型没有得到充分的保护。这种差距源于根本性的架构转变:扩散 Transformer (DiTs) 通过联合注意力将语义注入和视觉合成纠缠在一起,这使得隔离和消除一代中的风险内容变得困难。为了弥补这一差距,我们研究了语义概念在 DiT 中的表示方式,并发现注意力头表现出特定于概念的敏感性。此属性可以检测和抑制危险内容。基于这一发现,我们提出了 AHV-D\&S,这是一种用于 DiT 中图像生成的 无需训练 推理时间保护措施。具体来说,AHV-D\&S 将所有注意力头中每个文本标记的敏感性量化为注意力头向量(AHV),该向量用作检测风险生成倾向的判别性签名。在推理阶段,我们提出了一种基于动量的策略,可以在去噪步骤中动态跟踪 token-wise AHV,以及一种敏感性引导的自适应抑制策略,可以根据特定头部的风险评分来抑制已识别风险 token 的注意力权重。大量实验表明,AHV-D\&S 在保持视觉质量的同时,有效抑制色情、版权风格和各种有害内容,并进一步表现出针对对抗性提示的强大鲁棒性以及跨不同基于 DiT 的 T2I 模型的可迁移性。