UniNDM:针对文本到图像生成中的色情内容的统一噪声驱动检测和缓解框架
UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
摘要
尽管文本到图像扩散模型具有令人印象深刻的生成能力,但它们仍然容易受到隐式性提示的影响,其中伪装成良性术语或对抗性标记的微妙提示由于模型偏差或训练数据中的潜在相关性而意外地生成不适当的内容。现有的安全机制面临着根本性的限制:检测方法主要识别显式内容,无法捕获隐式恶意意图,而缓解方法依赖于静态的负面提示,不足以适应各种隐式场景。为了应对这些挑战,我们提出了 UniNDM,这是一个统一的噪声驱动框架,它通过扩散过程中的噪声动力学视角重新思考安全机制。我们的主要见解是,早期预测的噪声表现出正常内容和露骨内容之间的固有可分离性,我们从理论上证明了语义集中度随着时间步长呈二次方增加。利用这一特性,我们开发了一种轻量级的基于噪声的检测器,几乎无需计算开销即可实现卓越的精度。为了缓解这种情况,我们引入了噪声增强的自适应负面引导:通过 大语言模型 动态生成特定于上下文的负面提示来处理不同的隐式内容,同时通过抑制对显式标记的注意力集中来优化初始噪声,以提供全面的保护。除了基于 U-Net 的扩散模型之外,我们还通过针对统一多模态注意力量身定制的区域约束语义指导,进一步将我们的框架扩展到新兴的扩散 Transformer 架构。在自然数据集和对抗数据集上对 U-Net 模型和 DiT 模型进行的综合实验表明,与最先进的方法(包括 SLD、UCE、Safree 等)相比,有了显着的改进。我们的代码可在 https://github.com/Aries-iai/UniNDM 上公开获取。