论文
DiSCO:通过分布引导的对比提示优化为文本到图像生成提供防御
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
摘要
随着文本到图像生成模型的进步,它们引发了关键的安全担忧,尤其是暴力、裸露等不适宜工作场所(NSFW)内容的生成,而红队对抗攻击进一步加剧了这一问题。现有防御主要在白盒假设下运行,依赖文本编码器优化、权重编辑或推理时干预,根本上无法扩展到专有模型。基于LLM提示重写的黑盒替代方案适用面更广,但会在我称之为良性对抗(benign adversarial)问题的关键情形中失效:语言上安全却因模型学到的数据分布而仍触发有害生成的提示。我们提出DiSCO,一种零样本、严格黑盒的防御,完全在提示层面作为即插即用模块运行,无需模型重训练、微调或访问模型内部。DiSCO通过束搜索执行分布引导的后缀扩展,利用目标模型自身生成的安全与不安全图像池进行对比评分优化,并迭代自适应反馈直至产出安全内容。我们证明DiSCO在I2P基准上、在多种红队攻击下持续提升未防御与已防御模型的安全性,分别实现37.7%和25.13%的ASR下降,同时保持语义保真度并改善图像连贯性。作为一个黑盒、架构无关的模块,DiSCO可以便捷地应用于任何文本到图像系统,而无需对模型本身做任何更改。
