论文
零样本参考图像分割图像编辑模型的早期语义基础
Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation
摘要
基于指令的图像编辑(IIE)模型最近表现出了根据自然语言指令修改特定图像区域的强大能力,这隐含地需要识别应在何处应用编辑。这表明此类模型本质上执行语言条件的视觉语义基础。在这项工作中,我们研究了这种隐式基础是否可以用于零样本参考图像分割(RIS),这是一项需要对自然语言表达式描述的对象进行像素级本地化的任务。通过系统分析,我们揭示了在最早的去噪时间步长(远在任何可见图像变换发生之前),这些模型的内部表示中出现了很强的前景-背景可分离性。基于这一见解,我们提出了一个 无需训练 框架,该框架通过利用中间表示来重新利用 RIS 的预训练图像编辑模型。我们的方法将定位分解为两个互补的组成部分:基于注意力的空间先验,用于估计聚焦位置,以及基于特征的语义辨别,用于确定要分割的内容。通过利用特征空间可分离性,该框架仅使用单个去噪步骤即可生成准确的分割掩模,而不需要完整的图像合成。对 RefCOCO、RefCOCO+ 和 RefCOCOg 进行的大量实验表明,我们的方法比现有的零样本基线具有卓越的性能。