论文
VIRST:用于时空分割的视频指导推理助手
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
摘要
参考视频对象分割(RVOS)旨在基于自然语言描述来分割视频中的目标对象。然而,将视觉语言模型与单独的传播模块相结合的基于固定关键帧的方法通常无法捕获快速变化的时空动态,也无法处理需要多步推理的查询,从而导致超出静态 RVOS 基准的运动密集型和面向推理的视频的性能急剧下降。为了解决这些限制,我们提出了 VIRST(用于时空分割的视频指令推理助手),这是一种端到端框架,它将全局视频推理和像素级掩模预测统一在单个模型中。 VIRST 通过时空融合 (STF) 连接语义和分段表示,将分段感知视频特征融合到视觉语言主干中,并采用时间动态锚更新器来维护时间相邻的锚帧,从而在大运动、遮挡和再现下提供稳定的时间线索。这种统一的设计在现实和具有挑战性的条件下在不同的 RVOS 基准上实现了最先进的结果,展示了对参考和推理导向设置的强大泛化能力。代码和检查点可在 https://github.com/AIDASLab/VIRST 获取。