论文
展望窗外:无需训练 开放词汇语义分割的全局-局部对齐 CLIP
Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation
摘要
最近的无需训练开放词汇语义分割方法普遍采用滑动窗口推理策略来克服CLIP在处理高分辨率图像中的局限性。然而,这种方法引入了一个新的挑战:每个窗口都是独立处理的,导致跨窗口的语义差异。为了解决这个问题,我们提出了 Global-Local Aligned CLIP~(GLA-CLIP),这是一个促进跨窗口全面信息交换的框架。 GLA-CLIP 没有将注意力限制在单个窗口内的标记,而是扩展了键值标记以合并来自所有窗口的上下文提示。然而,我们观察到窗口偏差:外部窗口标记不太可能被关注,因为查询特征是通过内部窗口补丁内的交互产生的,因此缺乏超出其本地上下文的语义基础。为了缓解这个问题,我们引入了一个代理锚点,它是通过聚合与所有窗口中的给定查询高度相似的标记来构建的,它为测量内部和外部窗口补丁之间的相似性提供了统一的语义参考。此外,我们提出了一种动态归一化方案,通过动态缩放和阈值化注意力图来根据对象尺度调整注意力强度,以应对小对象场景。此外,GLA-CLIP 可以配备在现有方法上并扩大其接受范围。大量实验验证了 GLA-CLIP 在增强 无需训练 开放词汇语义分割性能方面的有效性。代码可在 https://github.com/2btlFe/GLA-CLIP 获取。