论文
对编辑而不是图像进行建模:从以源为中心的角度进行视觉自回归编辑
Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective
摘要
下一代视觉自回归模型(VAR)已成为一种强大的生成范式,通过有效的从粗到细的预测生成高质量的图像。然而,它们在文本引导图像编辑方面的潜力在很大程度上仍未得到充分开发。现有的 无需训练 VAR 编辑方法通常将编辑制定为受源图像引导或约束的目标条件再生,并且可能依赖于反演、测试时优化、注意力控制或用户提供的掩模。这种以生成为中心的公式并没有充分利用 VAR 提供的多尺度源表示,并且可能会引入额外的计算或干预。相反,我们对 VAR 编辑采取以源为中心的视角,其中编码的源图像标记充当主要视觉状态,编辑过程侧重于条件引起的变化。基于这个观点,我们提出 \textbf{EditMod},它在共享自回归上下文下比较源条件和目标条件预测,将它们的差异视为尺度编辑方向,并将其作为所选尺度下源标记的残差更新。实验表明,EditMod 在保持强大的文本对齐的同时实现了领先的源图像保真度,并且在单个 A100 GPU 上仅用 1.57 秒即可完成 1K 图像的端到端编辑,而无需每个图像准备。