论文
3D 视觉语言中从对齐到融合
From Alignment to Fusion in 3D Vision-Language
摘要
统一的 3D 视觉语言系统必须结合互补的几何形状、比例和外观线索,同时支持从实例分割到语言引导推理的任务。现有方法通常独立处理点云、体素网格和多视图图像;直接组合这些异构表示可能会留下大量未解决的特征差异,而随后的无约束适应可能会扭曲其内部几何形状。我们提出了一种对齐然后融合框架,该框架首先应用三重成对余弦对齐来建立跨三个表示的段级对应关系,然后使用提示引导的查询解码器检索任务条件特征。在融合之前,特定于表示的查询特征通过受限于特殊正交组的可学习映射进行转换。这些映射保留每个表示内的内积和欧几里德距离,允许受控的特定于表示的重新参数化,而不会任意扭曲其内部几何形状。随后,转换后的特征在下游任务监督下通过自适应融合进行组合。实验涵盖八个数据集,例如分割、视觉基础、问题回答和密集字幕。与 PQ3D 相比,该模型在 ScanNet200 上的平均精度提高了 3.2 个点,在 ScanRefer、Nr3D、Sr3D 和 Multi3DRefer 上的视觉定位精度分别提高了 2.9、10.6、4.6 和 4.1 个点,同时还提高了 ScanQA、SQA3D 和 Scan2Cap 上的性能。消融进一步支持对齐和正交重新参数化的互补作用以及自适应融合的有效性。