论文
SafeDiffusion-R1:安全扩散的在线奖励指导 后训练
SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
摘要
扩散模型已被广泛研究,用于消除在 预训练 期间学到的不安全内容。现有方法需要昂贵的监督数据,要么是不安全文本与安全图像真实值配对,要么是负/正图像对,这使得它们难以扩展。此外,离线生成合成数据的离线强化学习和有监督的 微调 方法会遭受灾难性遗忘,从而降低生成质量。我们提出了一种新颖的在线强化学习框架,通过 后训练 以及针对负面和正面文本提示的组相对策略优化(GRPO)来解决数据稀缺和模型退化问题。为了消除对 微调 专门的安全/不安全奖励模型的需求,我们引入了一种 \textit{转向奖励机制},它利用 CLIP 嵌入的固有属性:将文本表示转向正安全方向,远离嵌入空间中的负安全方向。我们的在线策略方法使模型能够从各种提示中学习,包括明确的不安全内容,而不会发生灾难性的遗忘。大量实验表明,我们的方法将不当内容减少到 18.07\%(相对于 SD v1.4 的 48.9\%),将裸体检测减少到 15 个(相对于 646 基线),同时将 GenEval 上的构图生成质量从 42.08\% 提高到 47.83\%。值得注意的是,这些安全收益泛化到七个危害类别的域外不安全提示,无需监督配对数据或奖励调整即可实现最先进的性能。 Github:https://github.com/MAXNORM8650/SafeDiffusion-R1。