论文

用于文本扩散模型的安全感知降噪器

The Safety-Aware Denoiser for Text Diffusion Models

模型推理解码与生成控制

摘要

最近关于文本扩散模型的工作为自回归生成提供了一种有前景的替代方案,但对其安全性的控制仍未得到充分探索。现有的安全方法面向自回归模型,通常依赖于事后过滤或推理时间干预。这些不足以有效解决文本传播模型中的安全风险。我们提出了安全感知降噪器(SAD),这是文本传播模型中的安全指导框架。 SAD 修改了迭代去噪过程,以便最终去噪步骤中的文本样本被引导至文本空间中可证明安全的区域。这种推理时间方法可以将安全约束集成到降噪器中,避免对底层扩散模型进行计算成本高昂的重新训练,并实现灵活、轻量级的安全指导。我们使用 SAD 评估生成文本在危险分类、记忆和越狱方面的安全性。实验结果表明,SAD 大大减少了不安全生成,同时保持了生成质量和流畅性,优于现有方法。这些结果表明,我们在去噪期间的安全指导为增强文本传播模型的安全性提供了有效且可扩展的机制。