论文
视觉语言嵌入的交叉关注多视图融合
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
摘要
视觉语言模型一直是开放词汇二维语义分割发展的关键。然而,将这些模型从 2D 图像提升到 3D 场景仍然是一个具有挑战性的问题。现有方法通常跨视图反向投影和平均 2D 描述符,或者启发式选择单个代表性描述符,这通常会导致次优的 3D 表示。在这项工作中,我们引入了一种新颖的多视图 Transformer 架构,该架构从多个视点交叉参与视觉语言描述符,并将它们融合到统一的每 3D 实例嵌入中。作为第二个贡献,我们利用多视图一致性作为这种融合的自监督信号,当添加到标准监督目标类损失时,它显着提高了性能。我们的 Cross-Attentive Multiview Fusion(我们用首字母缩写词 CAMFusion 表示)不仅始终优于朴素平均或单视图描述符选择,而且还在 3D 语义和实例分类基准上取得了最先进的结果,包括对域外数据集的零样本评估。