论文

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

模型训练强化学习Agentic RL

摘要

文本引导的图像编辑凭借扩散模型和统一的多模态基础模型迅速发展。然而,大多数现有方法仍然局限于单轮设置,忽略了多轮上下文编辑的更现实场景,其中用户通过一系列指令迭代地细化图像。在这种情况下,模型必须遵循每条新指令,同时保留累积的会话级约束,并受到两种耦合故障模式的挑战:长上下文稀释(稀疏文本约束变得难以从不断增长的交错图像文本历史中恢复)和状态污染(早期的编辑错误会降低后代的质量)。我们介绍 Edit-R2,这是一种用于统一多模态模型的新型强化学习后训练框架。 Edit-R2 重建操作会话意图,在每次编辑之前有效地将分散的历史约束整合为明确的推理轨迹。它通过统一的目标进一步实现推理和生成上的多轮强化学习,联合优化离散文本空间中的意图重建生成和连续潜在空间中的流匹配图像生成,同时轨迹过滤机制抑制损坏的执行轨迹以稳定状态污染下的训练。为了支持系统评估,我们引入了 MICE-Bench,这是一个用于多回合上下文编辑的大型基准,具有针对指令跟随 (IF)、内容一致性 (CC) 和累积会话限制的全局意识 (GA) 的自动指标。实验表明,与强大的基线相比,Edit-R2 显着改进了多轮上下文编辑,并实现了具有竞争力的性能。

Edit-R2:面向多轮图像编辑的上下文感知强化学习:论文配图
图 1:上下文编辑概述。 (a)-(b):内容记忆任务。会话级约束要求所有添加或修改的元素均为紫色。 BAGEL 在整个会话过程中都违反了这一约束,而 Edit-R2 忠实地遵守了它,每次都达到 GA = 1.0。 (c)-(d):内容理解任务。用户打算使用“its”来指代在前一回合中添加的 podium。BAGEL 无法解析共指,而 Edit-R2 每次都能正确编辑预期对象。为了演示而简化了说明。