论文
通过几何感知 蒸馏 增强文本驱动的视频分割
Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation
摘要
文本驱动的引用视频对象分割(RVOS)旨在在给定自然语言的视频中定位和分割目标对象。然而,现有模型通常是在具有朴素分割损失的 2D 图像或视频数据集上进行训练,这忽略了帧之间的几何一致性并导致空间理解薄弱。在本文中,我们提出了几何增强语言引导视频分割(GeoLaV),这是一个两阶段框架,可从图像中提取 3D 几何知识以增强文本驱动的视频分割。在第一阶段,我们通过单目新颖视图合成进行单目几何预训练,使模型能够通过大规模单图像数据集的空间对齐来获取几何一致的视觉表示。在第二阶段,我们引入几何感知 蒸馏 并在视频分割数据集上微调模型,从通用 3D 先验模型转移 3D 结构知识。此过程增强了 3D 意识并提高了分割中的时空连贯性和语言与视觉的对应。大量实验表明,我们仅使用图像分割数据的方法已经在 RVOS 中提供了显着的零样本泛化。当与视频上的 微调 的几何感知 蒸馏 结合使用时,我们的方法在多个 RVOS 基准测试中实现了最先进的性能。该代码可在 https://github.com/Tony1882880/GeoLaV 获取。