论文
YesTrack:通过基于 MLLM 的是/否验证来引用多对象跟踪
YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Verification
摘要
引用多对象跟踪 (RMOT) 旨在跟踪视频中与给定语言表达匹配的每个实例。尽管最近集成了多模态 大语言模型 (MLLM) 以增强泛化能力,但现有方法主要将它们降级为标题生成器的角色,需要外部模块来进行最终决策。这种范例不仅引入了额外的延迟,而且还严重未充分利用 MLLM 固有的视觉语言对齐功能。为了解决这些限制,我们提出了 YesTrack,这是一种新颖的两阶段 RMOT 方法,它将指称重新表述为判别性任务,直接利用 MLLM 进行是/否验证,而无需显式文本生成。为了进一步提高这种基于 MLLM 的验证的可靠性和效率,我们引入了两个轻量级时间一致性约束:时间置信先验(TCP)和时间参考传播(TRP)。我们通过提出 YesTrack-MOT 进一步验证了这种判别范式的普遍性,YesTrack-MOT 是通用多目标跟踪(MOT)的简单而高效的实例。 Refer-KITTI 和 Refer-KITTI-V2 上的实验表明,即使使用 Qwen3-VL 的最小变体实现,YesTrack 也能显着优于现有最先进的方法,同时保持高效率。代码发布于 https://github.com/ggbondrighthere24/YesTrack。