论文

GuardPaint:文本到图像生成的推测安全解码

GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

模型推理推理验证与自校正

摘要

文本到图像(T2I)扩散模型提供了强大的视觉生成,但其可控性带来了关键的安全挑战:对抗性提示可以将去噪轨迹引导至违反政策的内容,例如露骨的裸体或图形暴力。现有的防护措施大多在生成之前通过即时过滤或在生成之后通过图像分类起作用,使扩散过程本身不受保护,并且通常只会产生拒绝而不是安全的视觉修复。我们引入了 GuardPaint,这是一个用于安全 T2I 生成的 推测解码 框架,它可以在不修改基础模型的情况下干预扩散轨迹。轻量级审核员监视中间图像,定位不安全区域,并仅在需要时触发外科修复。候选修复由符合策略的修复程序生成,并通过受保护的锦标赛进行选择,只有当它们提高策略合规性同时保持即时保真度和感知质量时才接受编辑。跨越五个越狱系列 SneakPrompt、MMA、PGJ、DACA 和 RABell 以及 UNet/流匹配模型,包括 SD~1.5、SDXL、SD~3.5 和 FLUX.1-dev。 GuardPaint 可减少攻击成功率和有害生成,同时最大限度地降低图像质量、提示保真度和良性行为。内容警告:本文包含涉及裸露和暴力的示例,一些读者可能会觉得令人不安、痛苦或冒犯。