论文

RaysUp:通过几何感知光线表示进行超轻通用特征上采样

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

应用与实践视觉感知与空间理解

摘要

预训练的视觉基础模型(VFM)因其强大的语义表示和强大的泛化能力而成为现代计算机视觉的核心。然而,它们的补丁或池化输出本质上是低分辨率的,限制了它们在需要细粒度、像素级推理的任务中的有效性。现有的特征上采样方法要么降低语义保真度,要么依赖 VFM 特定的再训练和重型架构,从而阻碍效率和可扩展性。为了应对这些挑战,我们提出了 RaysUp,这是一种超轻量级、与任务无关、与 VFM 无关的特征上采样框架,可以以任意分辨率重建高分辨率特征图。与传统的 2D 插值或基于注意力的方案不同,RaysUp 将特征重建提升到几何感知的射线域中。具体来说,我们引入了用于方向感知引导编码的空间解耦引导编码器、用于分辨率灵活重建的任意分辨率交叉注意机制,以及通过 6D Plucker 射线坐标注入隐式 3D 几何先验的新型射线位置编码 (RayPE)。最后,几何感知邻域注意力模块进一步确保内容自适应双边聚合,同时保持几何一致性。跨不同密集预测任务的大量实验表明,RaysUp 实现了最先进的性能,同时仅使用 AnyUp 16% 的参数,并提供大约 7 倍的推理速度。这些结果凸显了准确性与效率权衡的显着提高,并将 RaysUp 确立为通用特征上采样的实用且可扩展的解决方案。代码可在 https://github.com/MAP-RaysUp/RaysUp 获取。