论文

在图像编辑中利用基于验证器的强化学习

Leveraging Verifier-Based Reinforcement Learning in Image Editing

模型训练奖励建模与过程监督

摘要

虽然人类反馈强化学习 (RLHF) 已成为文本到图像生成的关键范例,但其在图像编辑中的应用在很大程度上仍未得到探索。一个关键瓶颈是缺乏针对所有编辑任务的强大的通用奖励模型。现有的编辑奖励模型通常给出总体评分,而没有进行详细检查,忽略了不同的指令要求,导致奖励有偏差。为了解决这个问题,我们认为关键是从简单的记分员转变为推理验证员。我们引入了 Edit-R1,这是一个框架,它构建了基于验证者的推理奖励模型 (RRM) 的思想链 (CoT),然后利用它进行下游图像编辑。 Edit-RRM 将指令分解为不同的原则,根据每个原则评估编辑后的图像,并将这些检查聚合成可解释的、细粒度的奖励。为了构建这样的 RRM,我们首先应用监督 微调 (SFT) 作为“冷启动”来生成 CoT 奖励轨迹。然后,我们介绍群组对比偏好优化 (GCPO),这是一种强化学习算法,它利用人类成对偏好数据来强化我们的逐点 RRM。构建 RRM 后,我们使用 GRPO 来训练具有不可微分但功能强大的奖励模型的编辑模型。大量实验表明,我们的 Edit-RRM 作为特定于编辑的奖励模型超越了强大的 VLM(例如 Seed-1.5-VL 和 Seed-1.6-VL),并且我们观察到明显的扩展趋势,性能从 3B 参数持续提高到 7B 参数。此外,Edit-R1 为 FLUX.1-kontext 等编辑模型带来了好处,突出了其在增强图像编辑方面的有效性。