论文

感知锚定:无需训练 开放词汇语义分割的原型引导文本校准

Perceptual Anchoring: Prototype-Guided Text Calibration for Training-free Open-Vocabulary Semantic Segmentation

应用与实践视觉感知与空间理解

摘要

无需训练 开放词汇语义分割 (OVSS) 根据任意文本描述将图像划分为语义上不同的区域,而无需学习任何其他参数。然而,现有方法通常侧重于改进视觉表示,同时将仅编码通用类别概念的文本嵌入视为固定分类参考。这些通用概念与捕获目标实例特定外观的视觉表示之间产生的语义差距通常会导致非目标区域中的不完整掩模和错误预测。受感知锚定背后的符号感知对应的启发,我们为 无需训练 OVSS 提出了原型引导文本校准(PTC)。在感知阶段,PTC根据初始匹配分数选择可靠的视觉证据来构建特定类别的视觉原型。在锚定阶段,PTC使用这些原型来校准其相应的文本嵌入,并根据视觉证据的数量自适应调整校准强度。因此,校准后的文本嵌入与特定于实例的视觉表示更准确地对齐,同时保留通用类别语义和开放词汇泛化。此外,PTC 不需要额外的训练,也不需要外部模型,可以作为现有方法的即插即用模块。跨八个基准的大量实验表明,PTC 显着增强了六种代表性方法的性能,并产生更完整和准确的分割结果。这些结果验证了 PTC 是一种改善视觉文本对齐的简单而有效的方法。