论文
SIGMA:用于文本驱动图像操作本地化的语义差异指令视觉定位掩模注释器
SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization
摘要
文本驱动的图像编辑发展迅速,但可靠地定位这些操作需要在大型像素注释数据集上训练图像操作定位(IML)模型,并且仍然没有低成本的方法来大规模获取此类训练数据。我们观察到这些数据已经变相存在:公共编辑数据集包含数百万个与 IML 训练样本结构相同(原始、编辑)的对,仅缺少像素级掩模。自动恢复这些蒙版并非易事:像素差异被所有像素上扩散引起的扰动所淹没,并且仅指令视觉定位仅本地化提示所描述的内容,错过了意外的编辑器副作用。我们提出了 SIGMA(语义差异指令基础掩模注释器),它在视觉基础主干中执行语义特征差异,并通过双向跨模态细化将指令衍生的空间先验注入到该视觉流中,当编辑器忠实地实现用户意图时,放大预期编辑区域的差异信号。 SIGMA 接受两个互补阶段的训练:第一阶段监督修复掩模;第二阶段通过 VAE 往返噪声校准、EMA 自训练和编辑噪声解缠损失来关闭扩散域偏移。 SIGMA 在五个基准测试中优于现有的自动掩模生成器(+12.20% F1、+11.16% IoU)。当应用于公共编辑语料库时,它会生成约 110 万个 IML 训练集,该训练集将五个数据集中的六个不同检测器的 F1 提高了 +18.34%,将以前未使用的编辑数据转变为与模型无关的 IML 监督资源。论文被接受后,我们将立即发布完整的代码库。