论文

PixelUp:用于细粒度视觉任务的零样本语义特征上采样

PixelUp: Zero-Shot Semantic Feature Upsampling for Fine-Grained Vision Tasks

模型架构Transformer

摘要

自监督视觉基础模型(VFM)由于其强大且可转移的视觉表示而已成为下游任务的重要支柱。然而,当需要精确的细粒度预测时,它们的 patch-词元级 特征对于语义分割和深度估计等密集预测任务来说通常过于粗糙。特征上采样方法已经被开发来恢复像素级细节,但仍然面临局限性。可学习的上采样器通常是为特定编码器设计的,并且必须针对不同的编码器进行重新训练。使用浅像素编码器的图像引导方法通常会引入纹理伪影,并且缺乏准确的下游预测所需的语义指导。我们介绍了 PixelUp,一种与 VFM 无关的零样本上采样器,通过由多尺度语义特征引导的从粗到细的窗口交叉注意架构链实现语义感知。我们证明 PixelUp 的性能优于特定于 VFM 的上采样器和与 VFM 无关的上采样器,在密集预测任务上实现了最先进的性能,在语义分割上平均提高了 +1.2 mIoU,在跨 VFM 的 NYUv2 深度估计上平均提高了 +0.25 $δ_1$。 PixelUp 进一步将 无需训练 开放词汇和无监督语义分割平均分别提高了 +1.3 mIoU 和 +0.5 mIoU。代码可在 https://pixelup-project.vercel.app/ 获取