论文

S3VD:用于视频去雨的语义引导时空扫描

S3VD: Semantic-Guidance Spatio-Temporal Scanning for Video Deraining

摘要

大雨会破坏高频细节并引入运动模糊,从而严重降低户外视频的质量,严重破坏视觉任务的可靠性。最近,状态空间模型(SSM),特别是 Mamba,凭借其线性复杂性和对远程依赖性进行建模的能力,已成为视觉任务的有效替代方案。然而,当面对雨天视频中较差的视觉表示时,Mamba 在保持 2D 空间语义的完整性和建模 3D 时空相关性方面仍然面临困难。为了打破这些限制,我们引入了 S3VD,一种用于视频去雨的语义引导时空扫描框架,具有两项关键创新:多尺度语义融合(MSSF)模块和时空扫描融合(STSF)模块。前者集成了 DINOv2 的时间语义先验,以指导精确的特征表示并抵消 Mamba 1D 扁平化操作固有的局部语义上下文的丢失,从而增强了针对极端退化的鲁棒性。后者引入了时空扫描机制,并设计了解耦门控 Mamba (DG-Mamba) 层,该层采用两个独立的门来自适应控制输入剪辑中的前后上下文信息,从而优化帧内和帧间相关性建模。视频去雨基准实验证明了 S3VD 的优越性,与基于 Mamba 的基准相比,PSNR 平均提高了 0.84 dB,实现了最先进的性能。