论文

SPAR:用于开放词汇分割的单通道任意分辨率 ViT

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

摘要

基础视觉 Transformer (ViT) 由于其固定的 预训练 分辨率和固有的粗糙块级表示,在需要细粒度空间理解的任务中效果有限。这些挑战在密集预测场景中尤其明显,例如使用基于 ViT 的视觉语言模型进行开放词汇分割,其中高分辨率输入对于准确的像素级推理至关重要。现有方法通常使用 预训练 分辨率的滑动窗口策略来处理大分辨率图像。虽然这通过更精细的步幅提高了准确性,但它会带来巨大的计算成本。我们推出 SPAR:单通道任意分辨率 ViT,这是一种与分辨率无关的密集特征提取器,专为高效的高分辨率推理而设计。我们使用特征回归损失将精细的滑动窗口教师的空间推理能力提炼为单通道学生,而不需要架构更改或像素级监督。应用于开放词汇分割时,SPAR 将单遍基线提高了高达 10.5 mIoU,甚至超越了教师,展示了高效、高分辨率推理的有效性。代码:https://github.com/naomikombol/SPAR