论文
一次编辑所有地方的所有内容
Editing Everything Everywhere All at Once
摘要
在单次前向传播中编辑图像的多个元素是多轮图像操作的实用替代方案,可提高效率并可能更好的协调性。然而,当多个指令针对不同区域时,语义干扰通常会导致属性泄漏和糟糕的编辑解缠结,尤其是随着编辑数量的增加。在这项工作中,我们提出了 MICE(多实例并发编辑),这是一种使用多模态扩散 Transformer 进行可扩展多实例图像编辑的 无需训练 策略。 MICE 修改了联合注意力的加性偏差,以调节特定于实例的编辑指令、潜在的和通过用户提供的分段掩码识别的上下文标记之间的交互。具体来说,MICE 允许实例内注意力,惩罚相邻区域标记之间的交互,并抑制不相关的跨实例注意力。因此,我们的方法强制属性绑定,同时保持全局视觉一致性。我们在 LoMOE-Bench 上评估 MICE,并引入 MICE-Bench,这是一个更具挑战性的基准,每张图像平均有 8.5 次并发编辑。实验表明,我们的方法在视觉质量保留和编辑指令 忠实性 方面优于强大的基线和最近的竞争对手。