论文

语义对齐的梯度驱动的上下文保留图像编辑

Semantically Aligned Gradient-Driven Context-Preserving Image Editing

模型训练监督微调与指令调优

摘要

指令引导的图像编辑存在训练时盲点。生成编辑器永远不需要从语义上验证其输出是否确实满足指令。监督停止于重建和输入文本级调节。这会产生不完整的编辑、空间溢出和糟糕的定位。我们提出了 IABEdit,一个与模型无关的框架,它将可微语义验证嵌入到训练中。冻结的视觉语言模型从真实编辑中提取空间感知描述符。然后,可训练的对准器从生成的输出中再现它们。两者之间的残差成为一个梯度,告诉生成器要编辑什么以及在哪里编辑,并且没有推理时间 VLM 成本。 IABEdit 与各种骨干网兼容,包括 U-Net(稳定扩散)和 MMDiT(FLUX),而无需改变其推理管道。在 MagicBrush 上,它的结构保真度比最佳扩散基线提高了 +3.49 DINO-I,比最佳总体基线提高了 +1.26,同时在指令对齐方面保持竞争力。它还在基于嵌入指标的 RealEdit 和 EMU Edit 基准测试中实现了最先进的指令遵循性能。最重要的是,在 D-LORD 监控基准上,它在严重遮挡(保持身份最困难)的情况下超过了专有的 Gemini 代理 +5.13 DINO-P。这表明梯度对齐的 VLM 蒸馏在类似现实世界的监视和遮挡条件下仍然有效。人类和 GPT-4o 评估证实了感知精确、定位良好的编辑。