论文
SpatialFlow-GRPO:空间信用驱动图像编辑的地方
SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing
摘要
最近的在线强化学习大大提高了图像编辑质量。然而,现有的 Flow-GRPO 风格的方法通常依赖于单个全图像奖励,这使得细粒度的编辑优化变得困难。我们观察到图像编辑中的一个关键障碍是这种空间均匀性假设:整个图像奖励无法区分不同空间区域对图像质量的贡献。为了解决这个问题,我们提出了 SpatialFlow-GRPO,这是一个引入空间细粒度奖励反馈的训练框架。该框架将区域感知奖励转换为语义区域级优化信号,并在策略更新期间将区域优势与相应的潜在位置对齐。我们还训练了区域感知奖励模型 SFReward,用区域注释的编辑样本构建 SFReward-14K,并引入 MultiEditBench 来评估多区域编辑能力。在 OmniGen2 和 FLUX.2-klein-4B 上,SpatialFlow-GRPO 在 GEdit-Bench、ImgEdit-Bench 和 MultiEditBench 上的性能优于 Flow-GRPO。结果表明,SpatialFlow-GRPO 将局部反馈转换为空间对齐的更新信号,并提高了编辑质量。