论文
AnchorEdit:通过因果记忆保持多轮图像编辑中的时间一致性
AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory
摘要
多轮图像编辑对于迭代设计至关重要,但当前的模型经常面临连续步骤中的身份漂移和错误累积的问题。虽然现有的研究利用视频先验来保持一致性,但它们对双向注意力的依赖从根本上与交互式编辑的因果、顺序性质不一致。在本文中,我们提出了 AnchorEdit,这是第一个基于自回归 (AR) 扩散的框架,专为高分辨率、长期多轮编辑而设计。 AnchorEdit 通过三阶段训练课程弥合了视频先验和因果推理之间的差距:身份保留单轮预训练、因果 AR 通过新颖的自生成轨迹策略强制 微调 来减轻暴露偏差,以及用于高效 4 步生成的一致性 蒸馏。在推理过程中,我们引入了一种记忆机制来锚定初始主体身份并确保在扩展编辑轨迹上进行稳定的外推。为了评估性能,我们提供了一个新的高分辨率多轮编辑基准,旨在对长期稳定性进行压力测试。大量实验表明,AnchorEdit 实现了最先进的结果,在超过 10 轮交互后仍能保持出色的主题保真度和指导。