论文

OV3D-Bench:开放词汇单目 3D 检测的诊断基准

OV3D-Bench: A Diagnostic Benchmark for Open-Vocabulary Monocular 3D Detection

模型评测基准与评测资源

摘要

开放词汇单目 3D 探测器报告了强大的域内性能,但每个探测器都在不同的协议下进行评估,其中一些探测器依赖于部署时不可用的每个图像类别预言机,并且所有几何和语义都折叠为单个 AP 指标。为了解决这个问题,我们引入了 OV3D-Bench,这是一种诊断基准,可以在七个室内和室外数据集的实际部署条件下比较开放词汇单目 3D 探测器。我们的基准测试用测试时数据集级类名提示替换了每个图像的类名预言,并沿三个轴解耦了检测准确性:本地化、语义鲁棒性和跨域传输。我们评估了七个代表性检测器,发现(i)它们很好地定位了对象,但经常将正确定位的框错误地标记为语义上相邻的类别; (ii) 准确性对提示措辞高度敏感(例如,当提示“汽车的详细高分辨率照片”而不是“汽车”时,WildDet3D 的性能从 18.6 AP 下降到 5.4 AP); (iii) 广泛采用的目标感知协议隐藏了这些错误(例如,在 ScanNet 上将 DetAny3D 的 AP 膨胀 1.9 $\times$)。最后,我们证明,使用对比视觉语言编码器(例如 SigLIPv2)简单地重新映射冻结的封闭词汇检测器的预测,可以与最近专门构建的开放词汇方法相媲美。这表明几何定位更加成熟,而开放词汇语义仍然是主要瓶颈。