论文

DDMS:多视图基础特征到单视图模型的判别性 蒸馏

DDMS: Discriminative Distillation of Multi-view Foundational Features into Single-view Models

摘要

诸如 DINO 之类的基础视觉特征在现代计算机视觉中发挥着关键作用,并且最近已成为多视图前馈几何估计器的关键组件。在这项工作中,我们证明,通过将这些多视图模型(它们的 3D 几何内部知识)重新提炼成单视图估计器,我们可以获得增强的 3D 一致基础特征。我们的关键思想是通过将预训练的 2D 基础特征与多视图几何特征融合来构建多视图教师,并通过判别性排名目标来细化融合表示。通过我们的判别性 蒸馏 框架,我们强制学习的特征既具有 3D 一致性又具有局部独特性,同时保持它们与原始基础模型的特征空间保持一致,以保留预训练表示的语义结构。一致性和局部可辨别性对于 3D 计算机视觉问题(例如在图像之间形成语义和几何对应关系)至关重要。为了证明我们方法的有效性,我们进行了跨多个角度的综合实验:直接特征分析、密集预测传输以及显式 3D 提升和渲染。在这些评估中,我们的方法一致地产生更强大的 3D 感知基础特征,提高多视图一致性和局部可辨别性,同时保留原始表示的语义可转移性。