论文

我们可以在没有编辑奖励的情况下进行在线 RL 图像编辑吗?

Can We Perform Online RL for Image Editing without Editing Rewards?

模型训练奖励建模与过程监督

摘要

强化学习(RL)通过特定于编辑的奖励来实现图像编辑的直接偏好优化,但由于成本高昂的三元组监督和复杂的任务相关校准,这种奖励仍然不够发达。相比之下,文本到图像(T2I)的生成受益于成熟且多样化的奖励生态系统,涵盖语义对齐、美学、真实感、字形形状和其他视觉偏好。将这个生态系统扩展到图像编辑将大大拓宽基于强化学习的优化可访问的视觉偏好范围,从而提出核心问题:\emph{我们可以在没有编辑奖励的情况下执行图像编辑强化学习吗?}在本文中,我们认为标准图像编辑维度有可能映射到 T2I 奖励空间:图像质量可以直接转移,提示跟踪可以通过所需视觉状态的描述进行对齐,参考一致性通过对要保留的源内容进行编码来允许粗略的语义转换。然而,编辑指令指定了相对变化,而T2I奖励则需要独立的目标描述;此外,来自通用视觉语言模型的语义上有效的标题可能与冻结奖励不兼容。因此,我们进一步引入了 Lever-Edit,这是一个两阶段框架,它学习用于反事实目标描述的奖励对齐字幕,冻结它,并仅通过转移的 T2I 奖励来优化编辑策略。实验表明,与基于编辑奖励的 微调 相比,具有竞争性的编辑对齐和源代码保存,同时优于直观的传输基线。