论文

ViewSAM:学习视图感知跨模态语义,用于弱监督跨视图引用多对象跟踪

ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking

应用与实践视觉感知与空间理解

摘要

跨视图参考多对象跟踪(CRMOT)旨在跨多个摄像机视图跟踪由自然语言指定的多个对象,并具有全局一致的身份。尽管最近取得了进展,但现有方法严重依赖昂贵的帧级空间注释和跨视图身份监督。为了减少这种依赖,我们利用基础模型的功能探索弱监督下的 CRMOT。然而,我们的实证研究表明,直接应用 SAM2 和 SAM3 等基础模型,即使进行了特定于任务的修改,也无法准确理解引用表达式并保持跨视图的一致身份。然而,它们在生成可充当伪监督的可靠对象轨迹方面仍然有效。因此,我们将基础模型重新用作伪标签生成器,并提出了一个弱监督 CRMOT 的两阶段框架,仅使用对象类别标签作为粗粒度监督。在第一阶段,我们设计了一种亲和力引导的跨视图重新提示策略来细化和关联 SAM3 生成的跨摄像机轨迹,为后续训练生成可靠的跨视图伪标签。在第二阶段,我们引入 ViewSAM,这是一个基于 SAM2 构建的 CRMOT 模型,可显式建模视图感知的跨模式语义。通过将视图引起的变化制定为可学习条件,ViewSAM 弥合了视图变化的视觉观察和视图不变的文本表达之间的差距,只需大约 10% 的额外参数即可实现稳健的跨视图引用跟踪。大量实验表明,ViewSAM 在弱监督下实现了 SOTA 性能,并且与完全监督方法相比仍然具有竞争力。