论文
通过 蒸馏 辅助测试时间适应引导视频语义分割模型
Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation
摘要
完全监督的视频语义分割(VSS)严重依赖于密集注释的视频数据,限制了实际适用性。或者,逐帧应用预先训练的图像语义分割 (ISS) 模型可以避免注释成本,但会忽略关键的时间一致性。最近的基础模型(例如 SAM2)可以实现高质量掩模传播,但由于语义理解和计算开销有限,对于直接 VSS 仍然不切实际。在本文中,我们提出了 DiTTA(蒸馏 辅助测试时间适应),这是一种新颖的框架,可通过有效的测试时间适应(TTA)将 ISS 模型转换为时间感知的 VSS 模型,而无需带注释的视频。 DiTTA 在简短的单通道初始化阶段将 SAM2 的时间分割知识提炼到 ISS 模型中,并辅以轻量级时间融合模块来聚合跨帧上下文。至关重要的是,即使在适应高度有限的部分视频片段(例如初始 10%)时,DiTTA 也能实现强大的泛化,显着优于在推理过程中重复调用 SAM2 的零样本细化方法。 VSPW 和 Cityscapes 上的大量实验证明了 DiTTA 的有效性,相对于完全监督的 VSS 方法实现了有竞争力或优越的性能,从而为现实世界的 VSS 任务提供了实用且无注释的解决方案。