论文

在视觉自回归模型中使用屏蔽 logits 微调进行提示引导图像编辑

Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models

模型推理解码与生成控制

摘要

我们解决了视觉自回归模型中提示引导图像编辑的问题。给定源图像和目标文本提示,我们的目标是根据目标提示修改源图像,同时保留与请求的编辑无关的所有区域。为此,我们提出了 Masked logits Nudging,它使用源图像标记图来引入指导步骤,将目标提示下的模型预测与这些源标记图对齐。具体来说,我们使用 VAR 编码将固定源编码转换为 logits,沿着由源-目标提示定义的语义轨迹将模型的预测 logits 推向目标。编辑仅应用于通过专用掩码方案获得的空间掩码内,该方案利用源提示和编辑提示之间的交叉注意差异。然后,我们引入了一种改进方法来纠正量化误差并提高重建质量。我们的方法在 PIE 基准测试中以 512px 和 1024px 分辨率实现了最佳图像编辑性能。除了编辑之外,我们的方法还提供了忠实的重建,并且在 512 像素的 COCO 和 1024 像素的 OpenImages 上优于以前的方法。总体而言,我们的方法优于 VAR 相关方法,并实现了与扩散模型相当甚至更好的性能,同时速度更快。代码可在“https://github.com/AmirMaEl/MLN”获取。