论文
用于参考视频分割的事件感知指示助理
Event-Aware Instructed Assistant for Referring Video Segmentation
摘要
现有的参考视频分割方法通常将视频视为由多个图像组成的单个事件,而忽略了视频通常包含多个不同事件的事实。在这样的机制下,模型需要直接理解视频和文本中的所有复杂内容,这很容易导致混乱和幻觉。为了解决这个问题,我们建议通过可学习的事件查询将视频分解为一组简单的事件,并以逐个事件、易于理解的方式理解复杂的视频内容。这是基于这样的观察:自然语言表达通常将视频划分为不同的、与文本相关的片段,每个片段代表复合事件中的一个单独事件。我们推出了 EVIS,一种事件感知视频指令分割助手,它利用文本引导的事件查询将视频划分为简单的事件,提取事件感知的视觉文本特征以实现对视频的分层理解。此外,我们提出了对象像素混合学习,它使 MLLM 通过将细粒度像素特征与先前的对象查询相集成来跟踪长期视频中的目标。 5 个公共基准的广泛实验结果证明了 EVIS 在解决参考视频分割任务方面的强大性能。