论文

VibeEdit:使用 Canvas 指令进行图像编辑

VibeEdit: Image Editing with Canvas Instructions

模型训练应用与实践监督微调与指令调优强化学习内容创作

摘要

在文本引导的图像编辑中,描述所需的更改通常很简单,但识别预期的对象或区域可能很麻烦,尤其是当多个对象看起来相似时。我们引入了一个新的图像编辑界面,允许用户直接在图像上放置空间标记和可选的简短注释。这些注释共同构成了画布指令,指定编辑位置和更改内容。我们的编辑器 VibeEdit 按照这些说明执行对象添加、删除、替换、属性修改和移动,而无需单独的文本提示。我们使用对象掩码和结构化编辑描述构建了 155 万个源-目标编辑对,在训练期间从中渲染画布指令。我们将 Qwen-Image-Edit 与层解耦调节相结合,分别对源图像和画布指令进行编码以进行图像编辑。我们通过区域加权监督微调来训练模型,然后进行标题引导的强化学习,以提高编辑完成度、本地编辑质量和未编辑区域的保存。我们 根据独立构建、人工策划的基准评估 VibeEdit,该基准包含 419 个案例,强调相似对象中的目标选择。 VibeEdit 的 VLM 评分为 79.9,区域外 PSNR 为 32.8 dB,而 FireRed 为 67.4 和 24.0 dB,FireRed 是我们评估中得分最高的文本指导基线。