论文
用于可控图像编辑的可扩展最小变化学习
Scalable Minimal-Change Learning for Controllable Image Editing
摘要
图像编辑应该仅更改指令指定的属性,同时保留其他所有内容,但当前的方法经常会做出意想不到的更改。我们将这种最小变化原则视为基于指令的编辑的优化目标。潜在 L1 正则化不能很好地代表现代非线性生成器中的输出局部性,并且通常需要大规模的监督。相反,我们通过强化学习来优化编辑结果。 Agentic视觉语言奖励模型会审核每个源图像、指令和编辑图像的两种失败类型:未实现的请求更改和意外更改。组级别的标题合并并验证这些问题,以便在候选编辑之间提供一致的奖励,而无需按指令进行人工注释。在 FLUX.1 Kontext-dev 上,ARRO 将 MinEval、MagicBrush、AnyBench 和 Emu-Edit 的平均 EditScore 从 5.21 提高到 5.88。在 600 个评估示例中,相对于基础编辑器,它减少了 8.4% 的脱靶像素变化。奖励和 SFT 控制、盲人评估以及转移到 OmniGen2 提供了补充证据。代码:https://github.com/Showwwwwwwww/ARRO
