论文

FlowErase-RL:重新思考概念擦除作为流匹配模型中的奖励优化

FlowErase-RL: Rethinking Concept Erasure as Reward Optimization in Flow Matching Models

模型训练强化学习

摘要

流匹配模型的最新进展显着提高了文本到图像的生成质量,但也由于有害或不良内容的生成而带来了越来越大的安全风险。现有的概念擦除方法要么是有效性有限的推理时间干预,要么依赖于监督的 微调 (SFT),这需要精确对齐的数据,并且在可扩展性和多概念设置方面存在困难。在本文中,我们提出了 \emph{FlowErase-RL},这是第一个基于 GRPO 的框架,用于流匹配模型中的概念擦除。我们将概念擦除重新表述为奖励优化问题,并引入一种 \textbf{动态双路径奖励机制},该机制联合优化(i)概念擦除(CE)奖励以抑制目标概念和(ii)非目标空间(NS)奖励以保持生成保真度。两条奖励路径在训练过程中通过性能驱动的切换策略自适应平衡,从而无需明确的监督即可实现稳定的优化。关于裸体、物体和艺术风格擦除的大量实验表明,我们的方法实现了最先进的擦除性能,同时保持了强大的图像质量和语义对齐。此外,它对对抗性攻击表现出强大的抵抗力,并有效地扩展到多概念场景。我们的结果为流量匹配模型的安全可控生成建立了新的范例。