论文

基于流的图像编辑的区域约束组相对策略优化

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

模型训练强化学习

摘要

指令引导的图像编辑需要平衡目标修改与非目标保留。最近,由于其高保真度和高效的确定性 ODE 采样,基于流的模型已成为指令引导图像编辑的强大且日益采用的支柱。在此基础上,探索了基于 GRPO 的奖励驱动型 后训练,以直接优化特定于编辑的奖励,提高指令遵循和编辑一致性。然而,现有的方法经常受到噪声分配的影响:全局探索也会扰乱非目标区域,扩大组内奖励方差并产生噪声 GRPO 优势。为了解决这个问题,我们提出了 RC-GRPO-Editing,这是一种区域约束的 GRPO 后训练 框架,用于确定性 ODE 采样下基于流的图像编辑。它抑制背景引起的干扰方差,以实现更清晰的本地化贡献分配,提高编辑区域指令的一致性,同时保留非目标内容。具体来说,我们通过区域解耦的初始噪声扰动进行本地化探索,以减少背景引起的奖励方差并稳定 GRPO 优势,并引入注意力集中奖励,使交叉注意力与整个采样轨迹中的预期编辑区域保持一致,从而减少非目标区域的意外变化。 CompBench 上的实验表明,编辑区域指令依从性和非目标保留方面得到了持续改进。