论文
OV-Stitcher:无需训练 开放词汇语义分割的全局上下文感知框架
OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation
摘要
无需训练 开放词汇语义分割(TF-OVSS)最近因其能够利用大型视觉和视觉语言模型的预训练知识执行密集预测而无需额外训练而受到关注。然而,由于这些预训练编码器的输入分辨率有限,现有的 TF-OVSS 方法通常采用滑动窗口策略,独立处理裁剪后的子图像。虽然对于管理高分辨率输入有效,但这种方法阻止了对整个图像的全局关注,导致特征表示碎片化和上下文推理有限。我们提出了 OV-Stitcher,这是一个 无需训练 框架,它通过直接在最终编码器块内缝合碎片子图像特征来解决此限制。通过从碎片子图像特征中重建注意力表示,OV-Stitcher 在最终编码器块内实现全局注意力,产生连贯的上下文聚合和空间一致、语义对齐的分割图。对八个基准的广泛评估表明,OV-Stitcher 为开放词汇分割建立了可扩展且有效的解决方案,与之前的 无需训练 基线相比,平均交并集 (mIoU) 从 48.7 显着提高到 50.7。