论文
一致的多参考图像编辑评估验证奖励
Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
摘要
虽然最近的图像编辑模型取得了快速进展,但多参考编辑仍然具有挑战性,特别是在保持参考之间的视觉一致性和确保整体视觉和谐方面。强化学习已被证明对于文本到图像生成和单图像编辑非常有效,但由于缺乏捕获多图像关系约束的合适奖励模型,其扩展到多参考编辑受到阻碍。此外,天真地使用多模态 大语言模型(MLLM)作为零样本评估器面临着容易产生幻觉的长形式推理和短形式判断的有限演绎能力之间的关键张力。我们通过多维评估验证奖励(EVR)来解决这些问题。 EVR 将评估分解为不同的视觉标准;对于每个标准,MLLM 评估器都会生成多个候选假设,而验证器则以具体的视觉证据为基础来接受或拒绝每个主张,从而产生可靠且细粒度的奖励信号。与可扩展的数据管道一起,我们的方法使现成编辑器的 RL 微调 无需架构更改即可实现。大量实验表明,与基础 Qwen-Image-Edit 相比,有显着的进步,提高了一致性和和谐性,以匹配或超越 NanoBanana。