论文

TraceCLIP:从补丁到 CLS 的贡献中恢复本地语义

TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions

应用与实践视觉感知与空间理解

摘要

密集的视觉语言理解,包括对象定位、区域识别和开放词汇语义分割,需要将语言概念与空间基础的视觉区域相关联。 CLIP 通过从大规模对比 预训练 中学习共享图像文本嵌入空间,为这些任务提供了坚实的基础。然而,其图像级目标将文本与 CLS 派生的全局表示对齐,仅间接约束局部视觉语言对应。现有方法要么引入额外的监督、外部模型,要么引入特定于任务的适应,而 无需训练 方法主要从现有补丁特征中恢复密集响应,而不检查局部语义在 CLIP 中最容易访问的位置。我们引入了 TraceCLIP,这是一个 无需训练 框架,它通过隔离写入 CLS 注意输出的特定于补丁的术语来恢复潜在的补丁级语义证据。 TraceCLIP 进一步将贡献衍生的语义响应转换为语义测地拓扑门,该门校准最终层补丁亲和力以进行密集特征重建。诊断实验表明,这些贡献特征表现出很强的局部语义辨别力和文本条件的空间对齐。在八个零样本语义分割基准上,TraceCLIP 在主干网和背景设置上比最强的现有 无需训练 方法在平均 mIoU 上实现了 1.3 到 4.5 点的增益,而无需额外的训练、外部视觉基础模型或区域级监督。更广泛地说,这些发现表明,空间局部语义可能在全局对齐表示的内部构造中仍然是可访问的。