论文

MIRAGE:基准测试和对齐多实例图像编辑

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

应用与实践内容创作

摘要

指令引导的图像编辑在 FLUX.2 和 Qwen-Image-Edit 等模型中取得了显着进展,但它们仍然难以应对具有多个相似实例的复杂场景,每个实例都需要单独编辑。我们观察到,当面对多个相同的实例和复合指令时,最先进的模型会遭受严重的过度编辑和空间错位。为此,我们引入了一个专门设计用于评估多实例和多指令设置中的细粒度一致性的综合基准测试。为了解决我们的基准测试中观察到的现有方法的失败问题,我们提出了通过引导编辑进行多实例区域对齐(MIRAGE),这是一个 无需训练 框架,可以实现精确的本地化编辑。通过利用视觉语言模型将复杂指令解析为区域子集,MIRAGE 采用多分支并行去噪策略。这种方法将目标区域的潜在表示注入全局表示空间,同时通过参考轨迹保持背景完整性。对 MIRA-Bench 和 RefEdit-Bench 的广泛评估表明,我们的框架在实现精确实例级修改同时保持背景一致性方面显着优于现有方法。我们的基准测试和代码可在 https://github.com/ZiqianLiu666/MIRAGE 获取。