论文

Front-to-Back:非对称交叉视图车辆重新识别的视觉语言模型基准测试

Front-to-Back: Benchmarking Vision-Language Models for Asymmetric Cross-View Vehicle Re-Identification

模型评测基准与评测资源

摘要

在前后摄像头中匹配同一辆车很困难,因为摄像头不共享视图并且车辆的外观发生很大变化。我们推出 Front2Back-ReID,这是南非 20 个记录序列中 500 次手动验证车辆交接的基准。每个示例都要求模型将前置摄像头图像中突出显示的车辆与稍后后置摄像头图像中的至少三个候选车辆中的同一辆车进行匹配。我们评估了 7 个零样本视觉语言模型、4 个图像检索基线和 25 名人类参与者。使用完整的正面 RGB 图像、裁剪后的目标车辆和二元轮廓对模型进行测试。最强的 VLM 对目标裁剪图实现了 76.6% 的 Rank-1 准确度,而冻结 SigLIP2 基线的准确度为 74.0%;这种差异在统计上并不明显。人类参与者对完整图像的准确率达到 94.0%,对目标裁剪图的准确率达到 92.2%。在我们的评估设置下,启用推理可以提高在两种模式下评估的每个模型在所有三种输入条件下的准确性。我们还发现,VLM 在全场景上的表现通常比在目标裁剪图上的表现差。这些结果表明,通用 VLM 在前后车辆匹配方面尚未始终优于强大的视觉检索,而人类仍然更加可靠。