论文
通过速度编辑进行安全的几步生成
Safe Few-Step Generation via Velocity Editing
摘要
流匹配最近已成为最先进的文本到图像(T2I)生成的强大范例,可以通过少量采样步骤实现高质量生成。随着这些模型越来越多地集成到现实世界的应用程序中,确保安全和非敏感内容生成已成为一项关键要求。然而,使安全和概念去除方法适应这一新一代框架仍然是一个开放的挑战。具体来说,现有方法很大程度上依赖于跨多个去噪步骤的迭代轨迹引导或以 CLIP 为中心的提示嵌入操作。这些设计假设为基于流匹配的 T2I 生成的安全性带来了根本瓶颈,其中有限的采样步骤限制了迭代校正,而现代上下文感知文本编码器降低了嵌入级干预的有效性。在本文中,我们提出了 VESFlow,这是一种 无需训练 安全方法,专为流量匹配而设计,采样步骤极少。利用流匹配模型学习边际速度的事实,我们通过安全条件后验直接编辑速度场。 VESFlow 将轨迹转向安全输出,同时保持调节提示不变。基于 VESFlow 在良性提示下保持输出不变的观察结果,我们进一步引入了基于风险评分的过滤,该过滤绕过速度编辑以降低计算成本,同时保留良性提示生成。基于这种过滤,我们提出了 VESFlow+,这是 VESFlow 的一个更强的变体,它不仅可以将速度编辑到安全方向,还可以将其推离不安全方向。实验结果表明,VESFlow+ 删除了目标概念,在 4 步 MeanFlow 模型上将 NudeNet 的攻击成功率降低至 Ring-A-Bell 上的 6.3% 和 MMA-Diffusion 上的 6.8%,同时保留良性提示的保真度。