论文

DSS:动态语义引导,用于扩散模型中稳健的概念擦除

DSS: Dynamic Semantic Steering for Robust Concept Erasure in Diffusion Models

模型评测安全与风险评测

摘要

文本到图像 (T2I) 扩散模型引入了新的安全风险,因为攻击者可以利用灵活的文本提示来诱导生成敏感或违反策略的内容(例如 NSFW 或受版权保护的概念)。概念擦除已成为一种有前景的防御措施,旨在抑制目标语义,同时保留良性生成。然而,现有方法面临着一个根本性的权衡:基于训练的方法成本高昂且对新出现的威胁缺乏灵活性,而推理时间干预通常依赖于不受约束的特征操作,导致过度校正、语义漂移和实用性下降。更关键的是,他们缺乏对局部语义结构的明确理解,导致在对抗性或组合性提示下行为不稳定。在本文中,我们提出了动态语义引导(DSS),这是一种 无需训练 推理时间防御框架,用于在即时级别的对抗设置下实现稳健且可控的概念擦除。 DSS 引入了一种几何感知公式,可以显式地模拟局部语义邻域并限制该结构内的特征更新,这是在不牺牲良性语义的情况下实现精确抑制的关键。具体来说,DSS (i) 通过基于密度的边界建模自动识别良性语义锚点,以及 (ii) 使用交叉注意力信号和封闭式解决方案执行上下文感知、约束特征校正。大量实验表明,DSS 在不同的概念类别和对抗性提示中实现了强大且一致的抑制,平均擦除率达到 91.0\%,优于之前的防御 (18.6\%--85.9\%)。同时,DSS 大大减少了语义漂移并保持了生成保真度。