论文

通过运动、几何和语义适应来分割任何物体,以实现复杂的非线性视觉对象跟踪

Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking

应用与实践视觉感知与空间理解

摘要

传统的视觉对象跟踪(VOT)方法通常依赖于特定于任务的监督训练,这限制了它们对看不见的对象和具有干扰物、遮挡和非线性运动的挑战性场景的泛化。最近的视觉基础模型(以 SAM 2 为代表)从大规模预训练中学习了强大的视频理解先验知识,并为构建更强大和更通用的跟踪器提供了有前途的基础。然而,直接将 SAM 2 应用于 VOT 仍然不是最理想的,因为它没有明确地模拟目标运动动力学或强制跨帧的几何和语义一致性,而这两者对于可靠跟踪都是至关重要的。为了解决这个问题,我们提出了 SAMOSA,这是一种新的跟踪框架,通过明确地利用运动、几何和语义线索,使 SAM 2 适应复杂的 VOT 场景。具体来说,我们引入了一种轻量级非线性运动预测器来对目标动态进行建模并指导掩模选择以及内存过滤。我们进一步利用语义线索来检测目标移动并从跟踪失败中恢复,同时将几何线索作为结构约束来提高跟踪稳定性。通过这种方式,SAMOSA 弥补了 SAM 2 的隐式视频理解先验与显式跟踪导向建模之间的差距。大量实验表明,SAMOSA 在一般基准测试中始终优于最先进的基于 SAM 2 的方法,表现出比监督 VOT 方法更强的泛化能力,并在代表复杂非线性运动场景的反无人机数据集上取得了显着的成果。我们的代码可在 https://github.com/DurYi/SAMOSA 获取。