论文
ScribbleEdit:使用涂鸦和文本进行图像编辑的合成数据
ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text
摘要
生成模型的最新进展显着提高了图像编辑功能,但精确且直观的用户控制仍然很困难。具体来说,用户通常很难同时传达精确的空间布局和特定的语义细节。虽然自然语言指令有效地传达了纹理和颜色等高级语义,但它们缺乏空间特异性。相反,徒手涂鸦提供了粗略的空间边界,但无法表达详细的视觉属性。因此,实现精确控制需要结合这两种方式。然而,由于缺乏专门的训练数据,现有模型很难联合解释抽象涂鸦和文本。在这项工作中,我们引入了 ScribbleEdit,这是一个大型合成数据集,旨在通过将自然语言指令与徒手涂鸦输入相结合来弥补这一差距,以实现更准确、可控的编辑。我们通过合成管道构建此数据集,该管道通过修复自动生成源-目标图像对,然后将其与人类绘制的涂鸦和 VLM 生成的文本指令配对。使用 ScribbleEdit,我们评估和微调基于扩散和自回归的统一多模态图像编辑模型。我们的实验表明,虽然现成的模型难以处理抽象的涂鸦输入,但对我们的合成数据集进行微调可以显着提高它们生成空间对齐和语义一致的编辑的能力。