论文

瞬间视频:诊断视频 MLLM 对瞬间视觉事件的时间保真度

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

模型评测基准与评测资源

摘要

视频多模态 大语言模型 (MLLM) 在一般和长格式视频理解方面取得了快速进展,但其保留简短答案关键视觉证据的能力仍有待探索。许多实际问题是由瞬时视觉事件决定的:可能仅持续几帧的局部动作或状态转换。这些证据可以通过稀疏帧采样来跳过,通过视觉标记压缩来抑制,或者通过粗时间聚合来稀释,从而导致语言端推理无法可靠地恢复的故障。我们引入了 Moment-Video,这是一个通过瞬时视觉事件理解来诊断视频 MLLM 时间保真度的基准。每个问题都基于局部的、视觉可观察的和采样敏感的事件,要求模型注意、计数、描述或推理瞬时证据,而不是依赖持久对象、全局场景上下文或语言先验。 Moment-Video 包含 7 个领域和 25 个细粒度子类别的 1,000 个经过人工验证的视频 QA 对,涵盖四种任务类型:时间发生、时间计数、动作描述和时间推理。我们在 Moment-Video 上评估了 33 个专有和开源 MLLM。性能最好的模型 Seed-2.0-Pro 的总体准确率仅为 39.6%,而大多数开源模型仍低于 25%,这表明瞬时视觉事件理解方面存在巨大差距。诊断分析表明,更密集的帧采样改进了一些模型,但并没有消除瓶颈,而且更长的视频带来了更强的时间定位挑战。这些发现表明,当前的视频 MLLM 仍然缺乏捕捉、保存和使用简短但决定性的视觉证据的时间忠实表示。