论文

使用基础模型安全生成文本到图像的模块化能量控制

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模型推理解码与生成控制

摘要

控制文本到图像生成模型的行为对于安全和实际部署至关重要。现有的安全方法通常依赖于模型 微调 或精选数据集,这可能会降低生成质量或限制可扩展性。我们提出了一种推理时间引导框架,该框架利用来自冻结的预训练基础模型的梯度反馈来指导生成过程,而无需修改底层生成器。我们的主要观察结果是,视觉语言基础模型编码了丰富的语义表示,可以在生成过程中将其重新用作现成的监督信号。通过在每个采​​样步骤中通过干净的潜在估计注入此类反馈,我们的方法将安全转向制定为基于能量的采样问题。这种设计实现了模块化的 无需训练 安全控制,该控制与扩散和流量匹配模型兼容,并且可以推广到不同的视觉概念。实验证明了针对 NSFW 红队基准的最先进的鲁棒性和有效的多目标引导,同时在良性非目标提示下保持高生成质量。我们的框架提供了一种利用基础模型作为语义能量估计器的原则方法,从而为文本到图像的生成实现可靠且可扩展的安全控制。