论文

重新思考涂鸦引导的图像编辑:泛化、指令遵守和多任务处理

Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking

模型训练合成数据

摘要

涂鸦引导的图像编辑允许用户将简单的涂鸦注释与文本提示相结合,以指定图像的编辑位置和方式,从而实现灵活的交互和精确的空间控制。然而,现有模型在这种范式下仍然表现出不稳定的性能,特别是在多任务场景中。为了提高性能,我们使用开源编辑模型进行实证研究,并揭示了泛化的不对称性:指令级泛化,包括跨编辑任务以及从单任务到多任务设置,比图像域泛化更具挑战性,例如从合成图像到真实世界图像或从马赛克图像到常规图像。这表明主要瓶颈在于对不同编辑指令的学习不足,而不是图像域差距。受这一见解的启发,我们提出了三种策略:(a)覆盖然后现实主义课程,这是一个两阶段的管道,首先为广泛的任务监督构建大规模合成的、指令丰富的数据,然后管理一小部分现实世界数据来完善生成现实主义; (b) 多任务马赛克,它通过以几乎零成本连接单任务示例来构建多任务训练样本,同时使学习到的能力能够推广到非马赛克图像; (c) 编辑聚焦损失,它利用合成数据中输入和输出图像之间的变化区域将训练集中在编辑区域,从而提高学习效率和编辑准确性。通过这些策略,我们极大地改进了 VIBE 基准上的单任务和多任务涂鸦引导编辑,取得了最先进的结果。我们将公开发布我们的数据集和模型。