论文

通过中间干净估计进行安全文本引导图像生成的测试时间缩放

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

模型推理解码与生成控制

摘要

确保文本到图像传播模型的安全性和政策合规性仍然是一个严峻的挑战,因为良性或对抗性提示通常会引发禁止的内容,例如裸体和受保护的知识产权。虽然基于训练的忘却方法很有效,但它们的计算成本很高,并且容易对一般能力造成灾难性干扰。相反,现有的测试时防御主要以提示为中心,仅依赖于修改文本描述,而忽略了用于检测的视觉信号。在本文中,我们建议利用生成过程中估计的中间干净图像,并采用稀疏边缘目标来检测禁止的概念。当检测到违规时,我们立即通过截断反向传播优化文本调节空间中的结构化低秩残差来进行干预。这种设计允许重量保护检测,随着最大预算的增加,保持非违规推理延迟几乎不变,并通过测试时间缩放提供安全性能的灵活性。 Stable Diffusion v1.4 和 v3.5 在裸露去除、IP 保护和风格擦除方面的广泛实验表明,与之前的重量保持基线相比,在抑制、保真度和保留方面具有卓越的性能,为安全生成部署提供了可扩展且灵活的解决方案。