论文
G$^2$TAM:几何约束的任意目标跟踪模型
G$^2$TAM: Geometry Grounded Track Anything Model
摘要
人类的空间理解源于对几何和语义的共同感知,从而实现跨视点和时间的一致的对象识别和定位。当前的视频分割模型依赖于明确的对象外观记忆库进行实例跟踪,但它们仍然容易受到大视点变化和长期遮挡的影响。利用现代前馈 3D 重建模型提供的空间一致性,我们提出了几何约束的任意目标跟踪模型 (G$^2$TAM),这是一个仅使用无序 RGB 图像或视频进行 3D 中快速实例跟踪的统一框架。 G$^2$TAM 采用空间对齐的几何表示作为隐式记忆,确保跨帧和视图的稳定实例标识和本地化。其核心是跨模式空间编码器,它将视觉和文本提示集成到共享几何空间中,从而实现端到端空间重建和实例一致的掩模预测。为了支持训练和评估,我们构建了 InsTrack,这是一个大型数据集,具有用于基准测试的专用验证分割。大量实验表明,G$^2$TAM 具有强大的跨视图一致性、及时的实例空间跟踪、视频对象分割和空间重建,为交互式、基于几何的空间推理奠定了基础。