论文

迈向长远的开放世界视频分割

Toward Open-World Video Segmentation over Long Horizons

应用与实践视觉感知与空间理解

摘要

长视频挑战开放世界分割系统,以不断发现对象并通过消失和重新出现来保留其身份。 Savvy 是一个零样本、半在线、类不可知的系统,用于持久对象发现和身份维护,而 OGA 是一个评估套件,当其粒度与参考注释不同时,它会进行连贯的部分级预测。 Savvy 结合了模块化掩码发现、基于累积证据的延迟准入以及跟踪整合以维护不断发展的对象集。 OGA 允许多个预测支持一个参考,同时保留预测 ID,将粒度感知保真度与身份泄露和碎片化支持的诊断相结合。在 142 个 ScanNet 视频和 106 个 HM3D 轨迹中,使用上限为 1,500 个源帧的自适应采样前缀进行评估,在传统和 OGA 评估下,Savvy 在 VPQ_inf、STQ 和 AQ 方面均优于 DEVA+SAM 和 EntitySAM。传统的 VPQ_inf 在 ScanNet 上达到 18.44,而 DEVA+SAM 为 11.52,在 HM3D 上为 17.31,而在 HM3D 上则为 6.58。 VIPSeg 比较揭示了传统的一对一 VPQ 对注释粒度的敏感性。受控身份切断和闪烁测试表明,即使帧级掩码保持不变,OGA 也能检测到时间故障。总之,这些结果证明了互补的进步:Savvy 改进了长范围分割和关联,OGA 区分了连贯的部分级支持和时间身份失败。