论文
用于安全文本到图像生成的内省注意力调制
Introspective Attention Modulation for Safe Text-to-Image Generation
摘要
最先进的基于流的文本到图像(T2I)模型表现出卓越的生成能力,但仍然容易产生不安全的内容。先前的安全工作范围从概念擦除和提示过滤到基于分类器的门控。然而,简单的技术,如模型的参数有效适应,很容易绕过这样的护栏。我们引入了一种独特的原则性方法,通过推理时间内省调节模型的注意力动态来实现安全性,表现出内在的鲁棒性。我们的方法分析并重新平衡整个图像合成过程中的注意力激活,引导一代人远离不安全的概念,同时保持语义对齐。这种内省控制确保了部署模型的安全性。在标准和对抗性安全基准中,我们的方法取得了显着的安全分数,同时保持甚至提高了一致性和感知质量。我们的结果表明,与现有的概念擦除机制相比,注意力空间调节为基于 Transformer 的图像生成提供了一条更有希望的更安全扩散路径。我们的代码可以在 https://basim-azam.github.io/iam/ 访问。