论文
自动驾驶的零样本语义重识别:VLM 基线研究
Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study
摘要
自动驾驶中的重新识别 (ReID) 通常被表述为视觉匹配问题,其中使用学习的外观嵌入,对车辆、行人和骑自行车者的观察在时间、帧或摄像机视图之间关联起来,通常辅以运动、几何或多模态线索。然而,纯粹的视觉表示可能对视点、遮挡、照明和传感器域变化敏感,限制了它们在复杂驾驶场景中的可解释性和鲁棒性。我们提出了一项零样本管道的基线研究,使用视觉语言模型(VLM)生成检测到的流量参与者的文本描述,并评估这些描述是否可以支持跨观察的身份匹配。所提出的公式不是仅依赖于底层视觉相似性,而是通过结构化语义属性来表示每个对象,包括类别、颜色、形状、姿势、可见部分、空间上下文和独特的视觉线索。这项研究为自动驾驶场景中基于语言的重新识别提供了初步基准,讨论和评估了当前 VLM 在此任务中的优势和局限性。结果表明,零样本语义描述可以支持有效的对象重新识别,实现与受监督的 CNN 基线相当的检索性能,同时通过明确的身份线索提供更大的可解释性。然而,这些实验也揭示了重要的挑战,包括不同观点之间的属性不一致以及视觉相似实例之间有限的细粒度区分。