论文

PanoSAM2:SAM2 的轻量级失真和内存感知改编,用于 360 度视频对象分割

PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation

模型训练参数高效训练

摘要

360 度视频对象分割 (360VOS) 旨在预测 360 度视频中时间一致的掩模,提供全场景覆盖,使 VR/AR 和嵌入式 AI 等应用受益。由于缺乏高质量的标记数据集,学习 360VOS 模型并非易事。最近,Segment Anything Models (SAM),特别是SAM2——及其内存模块的设计——显示出强大、及时的VOS能力。然而,直接使用 SAM2 进行 360VOS 会产生令人难以置信的结果,因为 360 度视频存在投影失真、左右两侧语义不一致以及 SAM2 内存中对象掩码信息稀疏的问题。为此,我们提出了 PanoSAM2,一种基于 SAM2 的轻量级失真和内存感知自适应策略的新型 360VOS 框架,以实现可靠的 360VOS,同时保留 SAM2 的用户友好提示设计。具体来说,为了解决投影失真和语义不一致问题,我们提出了一种具有接缝一致感受野和迭代失真细化的全景感知解码器,以保持跨 0/360 度边界的连续性。同时,引入了失真引导掩模损失,通过失真幅度对像素进行加权,强调拉伸区域和边界。为了解决对象稀疏性问题,我们提出了一种长短期内存模块来维护紧凑的长期对象指针,以重新实例化和对齐短期内存,从而增强时间一致性。大量实验表明,PanoSAM2 比 SAM2 产生了显着的增益:360VOTS 上 +5.6,PanoVOS 上 +6.7,显示了我们方法的有效性。