论文

概念删除指南:安全扩散采样的证据校准负面指南

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

模型推理解码与生成控制

摘要

文本到图像的扩散模型仍然容易受到对抗性提示的影响,这些提示会引发不允许的内容,从而激发可靠的推理时间控制。一种流行的方法是负面指导,即以固定权重减去负面提示方向。然而,它通常会迫使安全性与保真度之间进行权衡,过度应用时会导致伪影或快速漂移,而应用不足时会因攻击而失败。动态变体使用后验概率信号重新加权指导,这对于开放词汇组合提示来说可能很脆弱,而基于轻量级相似性的方法则忽略了沿去噪轨迹不断变化的图像证据。我们引入了概念去除指导(CRG),这是一种 无需训练 方法,可根据模型的噪声预测估计每个扩散步骤中不需要的概念存在,并通过封闭形式约束更新自适应地校准负引导,强制目标存在阈值,同时最小化条件轨迹的扰动。在红队基准测试中,CRG 降低了攻击成功率,同时保持良性保真度,并扩展到其他抑制目标,例如艺术家风格和暴力,而无需 微调 或外部分类器。