论文
ReflexTrack:用于 无需训练 参考视频对象分割的反馈驱动代理
ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation
摘要
参考视频对象分割(RVOS)需要对整个视频中由自然语言指定的目标进行分割。最近的代理方法将多模态 大语言模型 与可提示的分割模型相结合,无需特定任务的训练即可执行 RVOS。然而,大多数管道依赖于一次性空间定位,然后进行掩模传播,使得初始提示和时间预测在很大程度上未经验证。我们引入了 ReflexTrack,这是一种反馈驱动的 无需训练 代理,可以在空间和时间层面上闭合这个循环。掩模引导的空间细化评估由当前关键帧提示引起的掩模,并迭代更新边界框以及正点和负点,从而产生更可靠的初始化。视频级掩模反射评估完整的掩模序列,定位不可靠的间隔,选择互补修复关键帧,并通过掩模引导的重新传播生成候选预测。只有提供经过验证的改进的候选者才会用于更新受影响的间隔,从而在其他地方保留可靠的预测。所有组件在推理期间保持冻结状态。 ReflexTrack 在 Ref-VPS 上的总 $\mathcal{Q}$ 得分为 $69.7$,在 ReasonVOS 上的 $\mathcal{J}\&\mathcal{F}$ 得分为 $67.2$。这些结果表明,预测级反馈大大提高了 无需训练 RVOS 的可靠性。