论文
SAM-MT:实时交互式多目标视频分割
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
摘要
现代视频对象分割(VOS)涉及跟踪和分割用户指定的目标。虽然最近的方法在单目标场景中取得了显着的性能,但将它们扩展到多目标设置通常需要复制每个单独对象的单目标处理,从而随着目标数量的增加而降低帧速率 (FPS) 和无限延迟。基于 Segment Anything 2 (SAM2),我们提出了 SAM-MT,它通过将模型转换为实时多目标视频分割的交互式框架来解决这个问题。 SAM-MT 使用显式查询来表示不同的单独目标,同时使用全局上下文的共享表示。它采用解耦的屏蔽注意力来保持个体身份与跨目标干扰的区别,并采用稀疏记忆来实现稳定的时间演化,以及用于遮挡处理和重叠预防的专门策略。 SAM-MT 成功地将延迟与目标数量解耦,实现与单目标基线相当的实时速度(10 个目标 >36 FPS),同时保持 SAM2 强大的视频分段性能。