论文
FeVOS:Foresight Expression 视频对象分割
FeVOS: Foresight Expression Video Object Segmentation
摘要
现有的引用视频对象分割任务侧重于描述观察帧内相关对象的事件、动作或外观的引用表达式,缺乏对需要预先决策时空推理的场景的评估,从而限制了其适用性。为了解决这个问题,我们提出了 Foresight Expression 视频对象分割,该任务查询即将到来的视频片段中的未来事件,并需要观察帧中的对象掩模作为视觉答案。例如,在以自我为中心的场景中,问题是“将使用什么工具?”需要对时空线索进行推理,以预测下一个要使用的工具的掩码,这有助于理解未来的行动和决策。为了支持这项任务,我们引入了 FeVOS,这是一个包含 968 个视频剪辑、14,525 个预见表达式和 2,904 个思想链注释的数据集,以提供明确且可解释的推理步骤。我们进一步开发了 FeVOS-R1,这是一种基于 MLLM 的模型,通过监督 微调 和强化学习的两阶段管道在我们的数据集上进行训练。 FeVOS-R1 不仅在 FeVOS 上实现了最先进的性能,而且还展示了对现有 RVOS 基准的强大泛化能力。我们希望这项工作能够激发更多关于视频感知中预测推理的研究。