论文

评估车辆属性识别的 2D 和 3D 感知视觉基础模型

Evaluating 2D and 3D-Aware Vision Foundation Models for Vehicle Attribute Recognition

模型评测模型能力评测

摘要

车辆属性识别是智能交通系统中的一项重要任务,特别是当自动车牌识别(ALPR)不可用或不可靠时。尽管视觉基础模型已显示出强大的跨领域可移植性,但其细粒度车辆分类的有效性仍未得到充分探索。此外,考虑到车辆固有的三维结构,尚不清楚新兴的 3D 感知基础模型是否比标准 2D 架构具有优势。本文提出了 14 个最先进的 2D 和 3D 感知视觉基础模型的实证基准。使用具有挑战性的现实世界 UFPR-VeSV 数据集,我们通过线性探测车辆类型、品牌和模型识别来评估这些模型作为冻结特征提取器。我们进一步对小样本学习和分布外(OOD)域转移下表现最佳的模型进行压力测试。我们的结果表明,标准 2D 自监督模型(尤其是 DINOv3)在细粒度任务中的性能大大优于 3D 感知模型,在品牌和模型识别方面实现了超过 93% 的宏观准确度。然而,3D 感知的 Depth Anything v2 在车辆类型分类中表现出更强的视角不变性。这些发现激发了将 2D 和 3D 先验结合起来的混合方法,以实现稳健的车辆识别。我们的代码可在 https://github.com/UFPR-IPASPPR/3D-Vision-Benchmark/ 上公开获取。