论文
走向语义不可知和形状感知的视觉语言分割模型
Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models
摘要
视觉语言分割模型最近通过利用以自然语言表达的高级语义对象类别取得了强大的性能。然而,这种语义依赖性限制了它们推理形状、几何或纹理等内在视觉属性的能力,而这些属性在许多现实世界的应用中至关重要。在这项工作中,我们引入了语义不可知和形状感知(SANSA)分割,这是一种新的范式,要求分割模型仅根据非语义文本描述进行操作。为此,我们提出了两种基于字典约束或示例指导生成 SANSA 分段提示的策略,两者都生成语义不可知的文本描述。然后,这些提示用于在语义不可知的监督下微调分割模型。实验表明,与预训练的最先进模型相比,对 SANSA 提示进行微调可使这一新分割任务的 mIoU 提高高达 20%,同时保持标准语义提示的强大性能。这些结果凸显了低级和中级视觉推理对于提高视觉语言分割模型的泛化性和可控性的重要性。