论文
无需训练 使用视觉语言模型进行语义多目标跟踪
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
摘要
语义多对象跟踪 (SMOT) 通过视频摘要、实例级描述和交互标签等语义输出扩展了多对象跟踪,旨在从轨迹转向人类可解释的动态场景描述。现有的 SMOT 系统是端到端训练的,将进展与昂贵的监督耦合起来,限制了快速适应新基础模型和新交互的能力。我们提出了 TF-SMOT,这是一个 无需训练 SMOT 管道,它组成了用于检测、基于掩模的跟踪和视频语言生成的预训练组件。 TF-SMOT 结合了 D-FINE 和可提示的 SAM2 分段跟踪器来生成时间一致的轨迹,使用轮廓定位通过 InternVideo2.5 生成视频摘要和实例描述,并通过基于注释的语义检索和 LLM 消歧将提取的交互谓词与 BenSMOT WordNet 同义词集对齐。在 BenSMOT 上,TF-SMOT 在 SMOT 设置内实现了最先进的跟踪性能,并与现有技术相比提高了摘要和字幕质量。然而,在细粒度和长尾的 WordNet 标签空间上进行严格的精确匹配评估时,交互识别仍然具有挑战性;我们的分析和消融表明语义重叠和标签粒度会严重影响测量的性能。