论文
仅推理提示投影可实现安全的文本到图像生成并具有电视保证
Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees
摘要
文本到图像 (T2I) 扩散模型可实现高质量的开放式合成,但其实际部署需要采取保护措施,在不降低良性提示图像对齐的情况下抑制不安全的生成。我们通过全变分 (TV) 镜头将这种张力形式化:一旦参考条件分布固定,不安全代的任何重要减少都必然会导致 TV 偏离参考,从而产生原则上的安全提示对齐权衡 (SPAT)。在这种观点的指导下,我们提出了一种仅推理的提示投影框架,该框架通过经过验证的代理目标选择性地干预高风险提示,将它们映射到容差控制的安全集中,同时保持良性提示有效不变,而无需重新训练或微调生成器。在四个数据集和三个扩散主干中,与强模型级对齐基线相比,我们的方法实现了不适当百分比 (IP) 相对减少 16.7-60.0%,同时在 COCO 上保持未对齐参考附近的良性提示图像对齐。
