论文

用于可控图像编辑的可扩展最小变化学习

Scalable Minimal-Change Learning for Controllable Image Editing

模型训练强化学习

摘要

图像编辑应该仅更改指令指定的属性,同时保留其他所有内容,但当前的方法经常会做出意想不到的更改。我们将这种最小变化原则视为基于指令的编辑的优化目标。潜在 L1 正则化不能很好地代表现代非线性生成器中的输出局部性,并且通常需要大规模的监督。相反,我们通过强化学习来优化编辑结果。 Agentic视觉语言奖励模型会审核每个源图像、指令和编辑图像的两种失败类型:未实现的请求更改和意外更改。组级别的标题合并并验证这些问题,以便在候选编辑之间提供一致的奖励,而无需按指令进行人工注释。在 FLUX.1 Kontext-dev 上,ARRO 将 MinEval、MagicBrush、AnyBench 和 Emu-Edit 的平均 EditScore 从 5.21 提高到 5.88。在 600 个评估示例中,相对于基础编辑器,它减少了 8.4% 的脱靶像素变化。奖励和 SFT 控制、盲人评估以及转移到 OmniGen2 提供了补充证据。代码:https://github.com/Showwwwwwwww/ARRO

用于可控图像编辑的可扩展最小变化学习的原论文方法或结果图
图 2:我们的Agentic奖励管道概述。对于每个编辑三元组 $(\bm{x}_{\text{src}},c,\bm{x}_{i})$,视觉语言模型 $\Phi_{\text{V}}$ 执行思维链审核,生成两个未实现和意外更改的原始列表。 LLM $\Phi_{\text{L}}$ 将 GDPO 组中的这些列表聚合为去重复的评分标准,而 $\Phi_{\text{V}}$ 根据共享评分标准重新评估每个候选者。由此产生的两个标量奖励 $(r^{(1)}_{i},r^{(2)}_{i})$ 均被归一化为每通道优势 $(A^{(1)}_{i},A^{(2)}_{i})$,然后组合成驱动基于流量的 GDPO 更新的最终优势。