论文
Edit-R2:面向多轮图像编辑的上下文感知强化学习
Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing
摘要
文本引导的图像编辑凭借扩散模型和统一的多模态基础模型迅速发展。然而,大多数现有方法仍然局限于单轮设置,忽略了多轮上下文编辑的更现实场景,其中用户通过一系列指令迭代地细化图像。在这种情况下,模型必须遵循每条新指令,同时保留累积的会话级约束,并受到两种耦合故障模式的挑战:长上下文稀释(稀疏文本约束变得难以从不断增长的交错图像文本历史中恢复)和状态污染(早期的编辑错误会降低后代的质量)。我们介绍 Edit-R2,这是一种用于统一多模态模型的新型强化学习后训练框架。 Edit-R2 重建操作会话意图,在每次编辑之前有效地将分散的历史约束整合为明确的推理轨迹。它通过统一的目标进一步实现推理和生成上的多轮强化学习,联合优化离散文本空间中的意图重建生成和连续潜在空间中的流匹配图像生成,同时轨迹过滤机制抑制损坏的执行轨迹以稳定状态污染下的训练。为了支持系统评估,我们引入了 MICE-Bench,这是一个用于多回合上下文编辑的大型基准,具有针对指令跟随 (IF)、内容一致性 (CC) 和累积会话限制的全局意识 (GA) 的自动指标。实验表明,与强大的基线相比,Edit-R2 显着改进了多轮上下文编辑,并实现了具有竞争力的性能。
