论文
使用视觉自回归模型重新思考文本引导图像编辑中的结构保留
Rethinking Structure Preservation in Text-Guided Image Editing with Visual Autoregressive Models
摘要
视觉自回归(VAR)模型最近作为一个有前途的生成模型系列出现,支持广泛的下游视觉任务,例如文本引导的图像编辑。通过将编辑范式从基于扩散的方法中的噪声操作转变为 词元级 操作,基于 VAR 的方法实现了更好的背景保留和显着更快的推理。然而,现有的基于 VAR 的编辑方法仍然面临两个关键挑战:准确定位可编辑标记和保持编辑结果的结构一致性。在这项工作中,我们提出了一种新颖的文本引导图像编辑框架,该框架植根于对 VAR 模型内中间特征分布的分析。首先,我们引入了一种从粗到细的标记定位策略,可以细化可编辑区域,平衡编辑保真度和背景保留。其次,我们分析了 VAR 模型的中间表示并识别与结构相关的特征,从而设计了一种简单而有效的特征注入机制,以增强编辑图像和源图像之间的结构一致性。第三,我们开发了一种基于强化学习的自适应特征注入方案,该方案自动学习特定于尺度和特定层的注入比率,以共同优化编辑保真度和结构保留。大量的实验表明,与最先进的方法相比,我们的方法在本地和全局编辑场景中都实现了卓越的结构一致性和编辑质量。