论文

仅推理提示投影可实现安全的文本到图像生成并具有电视保证

Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees

模型推理解码与生成控制

摘要

文本到图像 (T2I) 扩散模型可实现高质量的开放式合成,但其实际部署需要采取保护措施,在不降低良性提示图像对齐的情况下抑制不安全的生成。我们通过全变分 (TV) 镜头将这种张力形式化:一旦参考条件分布固定,不安全代的任何重要减少都必然会导致 TV 偏离参考,从而产生原则上的安全提示对齐权衡 (SPAT)。在这种观点的指导下,我们提出了一种仅推理的提示投影框架,该框架通过经过验证的代理目标选择性地干预高风险提示,将它们映射到容差控制的安全集中,同时保持良性提示有效不变,而无需重新训练或微调生成器。在四个数据集和三个扩散主干中,与强模型级对齐基线相比,我们的方法实现了不适当百分比 (IP) 相对减少 16.7-60.0%,同时在 COCO 上保持未对齐参考附近的良性提示图像对齐。

SPOT:经全变差选择性提示投影的仅推理安全文生图
(a) 富化比(Enrichment ratio)与转发比例 f(对数尺度)的关系,定义为 Pr(Q≤τ|Top_f(P))/Pr(Q≤τ)。