论文
M$^4$-SAM:具有记忆增强 SAM 的多模式专家混合,用于 RGB-D 视频显着目标检测
M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection
摘要
Segment Anything Model 2 (SAM2) 已成为通用分段的基础模型。由于其通用的视觉表示,SAM2 已成功应用于各种下游任务。然而,将 SAM2 扩展到 RGB-D 视频显着目标检测(RGB-D VSOD)任务遇到了三个挑战,包括线性 LoRA 的空间建模有限、SAM 的多尺度特征利用不足以及初始化对显式提示的依赖。为了解决这些问题,我们提出了具有记忆增强 SAM 的多模态专家混合 (M$^4$-SAM),它为 SAM2 配备了模态相关的 PEFT、分层特征融合和无提示记忆初始化。首先,我们将模态感知 MoE-LORA 注入 SAM2 的编码器,该模态感知 MoE-LORA 采用卷积专家对局部空间先验进行编码,并引入用于高效多模态 微调 的模态调度程序。其次,我们部署门控多级特征融合,它通过自适应门控机制分层聚合多尺度编码器特征,以平衡空间细节和语义上下文。最后,为了在没有手动提示的情况下进行零样本 VSOD,我们利用伪引导初始化,其中粗掩模被视为伪先验并用于引导存储体。大量实验表明,M$^4$-SAM 在三个公共 RGB-D VSOD 数据集上的所有评估指标上均实现了最先进的性能。