论文

FusionBERT:多视图图像--通过交叉注意力视觉融合和法线感知 3D 编码器进行 3D 检索

FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

摘要

我们提出了 FusionBERT,一种用于图像-3D 多模态检索的新型多视图视觉融合框架。现有的图像-3D 表示学习方法主要关注单个对象图像及其 3D 模型的特征对齐,限制了它们在通常从多个视点观察和捕获对象的现实场景中的适用性。尽管多视图观察自然地提供了互补的几何和外观线索,但现有的多模态大型模型很少探索如何有效地融合此类多视图视觉信息以实现更好的跨模态检索。为了解决这个限制,我们引入了一种名为 FusionBERT 的多视图图像 3D 检索框架,该框架创新性地利用基于交叉注意力的多视图视觉聚合器来自适应地集成对象多视图图像的特征。所提出的多视图视觉编码器融合了视图间的互补关系,并有选择地强调多个视图之间的信息丰富的视觉线索,以获得更稳健的融合视觉特征,从而实现更好的 3D 模型匹配。此外,FusionBERT 提出了一种法线感知 3D 模型编码器,可以通过联合编码点法线和 3D 位置来进一步增强对象模型的 3D 几何特征,从而为无纹理或颜色退化的 3D 模型提供更鲁棒的表示学习。对合成 3D 模型和真实工业机械物体进行的广泛图像-3D 检索实验表明,FusionBERT 在单视图和多视图设置下均比 SOTA 多模态大型模型实现了显着更高的检索精度,为多视图多模态检索建立了强大的基线。