论文
文本到图像扩散模型安全对齐的高实用性幻想
The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
摘要
文本到图像(T2I)扩散模型的安全对齐旨在抑制有害生成,同时保留良性提示的实用性。最近的方法通常看起来可以提供高安全性和高实用性,但这个结论很大程度上依赖于粗略的全局实用性指标(例如,FID、CLIPScore),这些指标对细粒度的语义正确性不敏感,从而产生了高实用性的错觉。我们表明,当通过结构化评估来衡量效用时,这种错觉就会被打破:在 TIFA(带有问答的文本到图像 忠实性 评估)上,安全对齐模型的语义保真度大幅下降,包括对象计数、属性和关系方面的失败。为了诊断这种差距的根源,我们分析了文本编码器提示嵌入空间并揭示了语义崩溃,嵌入扩展的收缩加上提示间相似性结构的扭曲,这与结构化效用损失密切相关。在这一见解的指导下,我们提出了 StructureAware Geometric Regularization (SAGE),这是一种安全对齐目标,可在适应过程中明确保留嵌入扩展和提示间关系结构。我们的方法恢复了结构化效用(TIFA 比之前最先进的技术高出 5.0%),同时保持强大的安全性能和有竞争力的粗粒度效用分数。我们的源代码和经过训练的模型可在 https://adeelyousaf.github.io/SAGE_ECCV26_Project_Page/ 获取。