论文

SAM2Dual:无需训练,用于长期视频对象分割的双内存

SAM2Dual: Training-Free, Dual Memory for Long-Term Video Object Segmentation

摘要

由于长期遮挡、重新出现和场景变化下的错误积累,长期视频对象分割(VOS)仍然具有挑战性。尽管 SAM2 提供了强大的零样本性能,但当最近的、不可靠的预测主导内存状态时,其流式内存可能会放大长期的漂移。我们提出了 SAM2Dual,这是一种 无需训练 即插即用推理时间增强功能,可以在不更新模型权重的情况下提高长视频的鲁棒性。 SAM2Dual 引入了双记忆设计,明确区分 (i) 用于快速局部适应的短期记忆和 (ii) 通过基于间隔的采样构建的长期记忆,以保留全局身份线索,并通过门控融合策略进行组合。此外,我们还提出了文本感知记忆(TAM),它从早期帧中提取紧凑的单词级提示,并使用文本嵌入根据语义兼容性重新加权记忆贡献,从而在视觉证据变得微弱或模糊时支持身份保留。在长期基准测试中,SAM2Dual 不断提高长视频的稳定性,将 MOSEv2 上的 J&F 从 49.33 提高到 50.65,并在 LVOSv2 上实现持续增长。