论文

高效跟踪和理解对象转换

Efficient Tracking and Understanding Object Transformations

应用与实践视觉感知与空间理解

摘要

通过状态转换跟踪对象对于理解现实世界的动态至关重要。然而,现有方法的计算成本很高。 TubeletGraph 最近展示了令人印象深刻的功能,但其推理成本(VOST 上每个对象帧约 4.4秒)排除了任何实时部署的可能性。我们观察到 TubeletGraph 的开销来自于构建输入视频的时空分区:(1)无论是否发生变换,都会对每一帧进行密集计算实体分割,(2)跟踪场景中的每个实体,根据场景复杂性而不是感兴趣的变换数量来缩放成本。为了解决这两个问题,我们提出了 FluxGraph,这是一种反应式变体,它使用 SAM2 的内部多掩模不一致作为变换检测的轻量级触发器,并且无需跟踪给定视频中的所有实体。 FluxGraph 比 VOST 上的 TubeletGraph 快约 3.3 倍,同时提高跟踪性能并保持状态图质量。此外,我们还观察到 VSCOS、M$^3$-VOS 和 DAVIS17 的加速速度一致为 3.7-10.7\times$,同时保持性能。代码可在 https://github.com/YihongSun/FluxGraph 上公开获取。