论文
通过强化学习安全生成图像
Safe Image Generation via Reinforcement Learning
摘要
近期文本到图像(T2I)模型具有出色的图像生成性能,但仍可能生成NSFW(不适合工作场所)内容,包括暴力或露骨图像。现有安全检查机制主要局限于生成前过滤,例如提示层面的文本分类器,或在图像完全合成后进行审核。然而,对抗攻击的操作空间更广,这种不平衡表明需要在生成过程中干预的安全机制。我们提出生成过程中的安全框架,监控去噪轨迹,并从中间表示中检测正在出现的NSFW信号。该方法不只检测NSFW生成,而是利用强化学习,从NSFW提示生成安全图像。通过结合生成过程中的检测与可控引导,即使NSFW信号在生成开始后才出现,也能缓解不安全轨迹。实验表明,该方法在标准和对抗评估集上持续优于现有安全图像生成方法,同时保持感知质量及对提示的忠实度。代码将在论文接收后发布。
