论文
在线推理视频对象分割
Online Reasoning Video Object Segmentation
摘要
推理视频对象分割可以根据自然语言查询预测视频中的像素级掩模,这些查询可能涉及隐式和基于时间的参考。然而,现有的方法是在离线状态下开发和评估的,其中整个视频在推理时可用,并且可以利用未来的帧进行回顾性消歧,这偏离了需要严格因果、逐帧决策的现实世界部署。我们研究在线推理视频对象分割(ORVOS),其中模型必须仅使用过去和当前的帧增量解释查询,而无需重新访问以前的预测,同时随着事件的展开处理指示物的变化。为了支持评估,我们引入了 ORVOSB,这是一个具有帧级因果注释和指称转移标签的基准,包含 210 个视频、12,907 个注释帧和跨五个推理类别的 512 个查询。我们进一步提出了一个具有不断更新的分割提示的基线和一个结构化的时间词元库,用于有界计算下的长范围推理。实验表明,现有的方法在严格的因果关系和指称变化下举步维艰,而我们的基线为未来的研究奠定了坚实的基础。