论文
DINO 吃掉 CLIP:超越已知的开放集 3D 对象检索
DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval
摘要
视觉基础模型通过有效适应多视图图像,在开放集 3D 对象检索 (3DOR) 方面展现出了巨大的前景。利用语义对齐的潜在空间,之前的工作通常采用 CLIP 编码器来构建基于视图的 3D 描述符。尽管 CLIP 具有很强的泛化能力,但它缺乏细粒度,促使我们探索更新的自监督编码器 DINO 的潜力。为了解决这个问题,我们提出了 DINO Eats CLIP (DEC),这是一种用于动态多视图集成的新颖框架,通过合成未见过的类的数据来规范化。我们首先发现,对来自冻结的 DINO 主干的视图特征进行简单的均值池化可以提供不错的性能。然而,进一步的适应会导致已知类别的平均视图模式严重过度拟合。为了解决这个问题,我们设计了一个名为分块和适应模块(CAM)的模块。它将多视图图像分割成块并动态集成局部视图关系,产生比标准池化策略更强大的特征。最后,我们提出虚拟特征合成(VFS)模块来显式减轻对已知类别的偏见。在底层,VFS 利用 CLIP 广泛的、预先对齐的视觉语言空间来合成看不见的类的虚拟特征。通过将 DEC 暴露给这些虚拟特征,我们大大增强了它的开放集判别能力。在标准开放式 3DOR 基准测试上进行的大量实验证明了其卓越的功效。