论文
通过动态奖励优化扩展多参考图像生成
Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
摘要
虽然个性化图像生成已经取得了显着的进步,但多参考图像生成(MRIG)仍然是一项具有挑战性的任务。大多数现有基准无法充分评估复杂的 MRIG 场景,阻碍了该领域的进一步进展。为了更好地评估复杂 MRIG 任务上的模型性能,我们引入了 OmniRef-Bench,这是一个涵盖参考图像类型和大量参考图像的复杂组合的基准测试。对OmniRef-Bench的评估表明,主流开源模型在复杂的MRIG场景中表现不佳,并且随着混合类型参考图像数量的增加,其性能显着恶化。为了解决这个问题,我们提出了 DyRef,一个两阶段训练框架。在第一阶段,有监督的 微调 使模型具备处理复杂 MRIG 任务的基本能力。在第二阶段,我们引入了难度感知优势重新加权(DAR)和区别性奖励缩放(DRS)。 DAR在处理大量混合类型参考图像时动态调整优化目标以提高性能。 DRS扩大了集团内部的奖励差异,以实现更有效的政策优化。实验表明,DyRef 显着提高了开源模型在 OmniRef-Bench 和单图像编辑基准上的性能,证明了我们方法的有效性和泛化能力。