论文
OVS-DINO:通过具有语言指导的结构对齐 SAM-DINO 进行开放词汇分割
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
摘要
开放词汇分割(OVS)旨在通过利用语义描述来分割预定义类别集之外的图像区域。虽然基于 CLIP 的方法在语义泛化方面表现出色,但它们经常缺乏密集预测所需的细粒度空间感知。最近的努力结合了像 DINO 这样的视觉基础模型(VFM)来缓解这些限制。然而,这些方法仍然难以实现高保真分割所需的精确边缘感知。在本文中,我们分析了 DINO 的内部表示,发现其固有的边界意识并非不存在,而是随着特征过渡到更深的 Transformer 块而逐渐衰减。为了解决这个问题,我们提出了 OVS-DINO,这是一种新颖的框架,通过与分段任意模型 (SAM) 的结构对齐来重振 DINO 的潜在边缘敏感性。具体来说,我们引入了结构感知编码器(SAE)和结构调制解码器(SMD),以使用 SAM 的结构先验有效激活 DINO 的边界特征,并辅以利用 SAM 生成的伪掩模的监督策略。大量实验表明,我们的方法在多个弱监督 OVS 基准测试中实现了最先进的性能,将平均分数提高了 2.1%(从 44.8% 到 46.9%)。值得注意的是,我们的方法显着提高了复杂、杂乱场景中的分割准确性,在城市景观上提高了 6.3%(从 36.6% 到 42.9%)。