论文

FlowGuard:通过线性潜在解码实现扩散模型的轻量级代内安全检测

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

基于扩散的图像生成模型发展迅速,但由于它们可能生成不安全工作 (NSFW) 内容,因此存在安全风险。现有的 NSFW 检测方法主要在图像生成之前或之后进行操作。预生成方法依赖于文本提示,并努力解决提示安全性和图像安全性之间的差距。后生成方法将分类器应用于最终输出,但它们不太适合中间噪声图像。为了解决这个问题,我们引入了 FlowGuard,一个跨模型的代内检测框架,用于检查中间去噪步骤。这在潜在扩散中尤其具有挑战性,其中早期噪声掩盖了视觉信号。 FlowGuard 采用新颖的线性近似进行潜在解码,并利用课程学习方法来稳定训练。通过及早检测不安全内容,FlowGuard 减少了不必要的扩散步骤,从而降低了计算成本。我们跨越九个基于扩散的骨干网的跨模型基准测试显示了 FlowGuard 在分布内和分布外设置中对一代 NSFW 检测的有效性,其 F1 分数优于现有方法 30% 以上,同时实现了变革性的效率增益,包括与标准 VAE 解码相比,峰值 GPU 内存需求减少了 97% 以上,投影时间从 8.1 秒缩短至 0.2 秒。