论文
多模态视频理解中视觉状态跟踪的基准测试
Benchmarking Visual State Tracking in Multimodal Video Understanding
摘要
理解视频需要的不仅仅是识别孤立的时刻,因为人类随着时间的推移不断跟踪实体、状态和事件。这种视觉状态跟踪能力是视频理解的基础,但在当前的多模态 大语言模型 (MLLM) 评估中仍未得到充分探索。我们推出视觉状态跟踪基准测试 (VSTAT),这是一种基于视频的基准测试,旨在诊断 MLLM 中的视觉状态跟踪。 VSTAT 由从合成视频和真实视频中提取的 834 个剪辑组成,并配有 1,500 个无法从任何单帧或短片段中回答的问题,需要对整个视频流中的事件进行连续感知和集成。尽管它们在现有视频基准上表现强劲,但我们发现最先进的 MLLM 的表现远低于人类,仅略高于答案先验基线。为了分析这一差距,我们将 MLLM 的思维轨迹与底层视频流进行比较,以了解 MLLM 在 VSTAT 上失败的原因和时间。我们发现 MLLM 在文本中正确推理和跟踪,但无法在视觉上感知他们需要跟踪的事件。最后,我们的初步评估表明,最近的代理方法(包括基于 MLLM 的视频代理和 编码智能体)并不能轻易解决这些故障,仍然达不到 VSTAT 的要求。