论文

SafeCtrl:通过检测然后抑制实现文本到图像扩散的区域感知安全控制

SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

模型训练模型编辑与遗忘

摘要

文本到图像传播模型的广泛部署受到视觉有害内容(例如色情内容、暴力和恐怖图像)生成的严重挑战。常见的安全干预措施,从输入过滤到模型概念擦除,通常受到两个关键限制:(1)安全和上下文保留之间的严重权衡,其中删除不安全概念会降低安全内容的保真度;(2)容易受到对抗性攻击,其中安全机制很容易被绕过。为了应对这些挑战,我们提出了 SafeCtrl,这是一种在“检测然后抑制”范例上运行的区域感知安全控制框架。与全局安全干预不同,SafeCtrl 首先采用注意力引导的检测模块来精确定位特定的风险区域。随后,通过图像级直接偏好优化 (DPO) 进行优化的局部抑制模块仅在检测到的区域内中和有害语义,有效地将不安全对象转换为安全替代品,同时保持周围环境完好无损。跨多个风险类别的广泛实验表明,与最先进的方法相比,SafeCtrl 在安全性和保真度之间实现了卓越的权衡。至关重要的是,我们的方法展示了针对对抗性即时攻击的更高的弹性,为负责任的生成提供了精确而强大的解决方案。