论文

MuRF:释放视觉基础模型的多尺度潜力

MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models

模型推理测试时计算扩展

摘要

视觉基础模型 (VFM) 已成为现代计算机视觉的基石,为各种任务提供强大的表示。虽然最近的进展允许这些模型在训练期间处理不同的输入大小,但推理通常仍然局限于单一的固定规模。这种流行的单尺度范式忽视了视觉感知的一个基本属性:不同的分辨率提供了互补的归纳偏差,其中低分辨率视图擅长全局语义识别,而高分辨率视图对于细粒度细化至关重要。在这项工作中,我们提出了多分辨率融合(MuRF),这是一种简单但普遍有效的策略,可以在推理时利用这种协同作用。 MuRF 不依赖单一视图,而是通过冻结的 VFM 以多种分辨率处理图像并融合所得特征,从而构建统一的表示。 MuRF 的通用性是其最引人注目的属性。它不依赖于特定的架构,而是作为视觉表示的基本 无需训练 增强。我们通过将 MuRF 应用于多个不同 VFM 系列(主要是 DINOv2)的广泛关键计算机视觉任务来实证验证这一点,但也证明了对 SigLIP2 等对比模型的成功泛化。