论文

文本视觉联合指导图像编辑

Text-Vision Co-Instructed Image Editing

应用与实践内容创作

摘要

现有的图像编辑方法一般可以分为基于文本指令的图像编辑方法和基于视觉提示的图像编辑方法。文本指令在语义上具有表达能力,但受到编辑结果空间控制的粗粒度的限制。相比之下,诸如拖动和点之类的视觉提示可以提供精确的空间引导,但受到语义意图固有的模糊性的限制。为了统一文本和视觉提示的强度,我们提出了文本视觉联合指令图像编辑,它将文本指令联合建模为语义意图,将稀疏视觉指令联合建模为空间指导,旨在实现精确且忠实于意图的图像操作。为此,我们首先构建了一个文本-视觉指令配对数据集,其中包含来自动态视频的超过 23K 样本,从而实现跨模式指令的对齐监督。然后,我们提出 TV-Edit,一种文本-视觉指令统一编辑框架,将拖动或基于点的视觉指令与图像文本语义关联起来,并将它们提升为预训练编辑主干的语义感知控制表示。通过集成语义意图和空间约束,与纯文本或基于拖动的替代方案相比,TV-Edit 可以实现更精确的空间控制、更少的指令歧义以及更强的结构一致性。最后,我们建立了 TV-Edit-Bench,这是一个精心设计的基准,用于评估语义 忠实性、空间对齐和与 真值 参考的视觉一致性以及受控的文本视觉变化,以进行可靠的评估。我们在多个编辑主干上进行的实验表明,TV-Edit 始终能够产生更精确、更忠实于意图的编辑,显着优于最先进的基于指令和基于拖动的基线。