论文

DIFTA-3D:深度一致的实例级特征传输和 DINOv3 的 3D 检测适配

DIFTA-3D: Depth-Consistent Instance-Level Feature Transfer and Adaptation of DINOv3 for 3D Detection

应用与实践视觉感知与空间理解

摘要

RGB-D 3D 实例检测器受益于视觉语义,但 IIFNet3D 使用的特定于任务的 Faster R-CNN/ResNet 分支将特征提取与单独训练的 2D 检测器及其图像域标签相结合。用冻结视觉基础模型替换该分支可以消除这种特定于任务的依赖性,但可能会引入遮挡噪声以及补丁特征和几何感知检测特征之间的不匹配。在这项工作中,我们通过将 DINOv3 适应 IIFNet3D 的实例级融合管道来研究这种替代。我们方法的核心是深度一致的特征管道,它将场景点投影到校准的 RGB-D 帧中,应用度量深度残差检查,将接受的 DINOv3 特征平均到离线点缓存中,并将缓存的特征聚合到建议对齐的 RoI 网格内。保留几何和双向实例融合路径,而 Conservative VAID 被评估为仅应用于正 RoIs 的低强度、支持加权语义蒸馏配方。我们对 ScanNetV2 进行了广泛的评估,以评估建议的传输方案。在 ScanNetV2 上,我们的 DINOv3 控制在 IoU 阈值 0.25 和 0.50 下分别获得了 76.15 和 60.93 的 mAP 分数。保守 VAID 设置的 mAP 分数为 76.59 和 62.16,在这个检查点级配方比较中,分别比对照提高了 0.44 和 1.23 分。报告的 IIFNet3D 结果 75.7/63.8 仅用作外部参考,因为视觉分支和处理协议不同。因此,我们将这些结果解释为受控转移配方的证据,而不是对 VAID 或深度过滤的个体贡献的因果估计。