论文

Video-MME-v2:迈向全面视频理解基准的下一阶段

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

模型评测基准与评测资源

摘要

随着视频理解的快速进步,现有的基准测试变得越来越饱和,暴露了夸大的排行榜分数与现实世界模型能力之间的严重差异。为了解决这一不断扩大的差距,我们引入了 Video-MME-v2,这是一个综合基准测试,旨在严格评估视频理解的鲁棒性和 忠实性。为了系统地评估模型能力,我们设计了一个 \textbf{渐进三级层次结构},它逐渐增加视频理解的复杂性,范围从多点视觉信息聚合到时间动态建模,最终到复杂的多模态推理。此外,与传统的每个问题的准确性相比,我们提出了一种 \textbf{基于组的非线性评估} 策略,该策略可以强制相关查询之间的一致性和多步骤推理中的连贯性。它会惩罚零碎的或基于猜测的正确性,并仅将信用分配给有有效推理支持的答案。为了保证数据质量,Video-MME-v2 通过严格控制的人工注释管道构建,涉及 12 名注释者和 50 名独立审阅者。 Video-MME-v2 拥有 \textbf{3,300 工时}和高达 \textbf{5 轮}的质量保证,旨在成为最权威的视频基准之一。大量的实验揭示了当前最佳模型 Gemini-3-Pro 与人类专家之间的巨大差距,并揭示了一个明显的层次瓶颈,视觉信息聚合和时间建模中的错误传播到限制高级推理。我们进一步发现,基于思维的推理高度依赖于文本提示,通过字幕可以提高表现,但有时会在纯粹的视觉环境中降低表现。通过暴露这些限制,Video-MME-v2 为下一代视频 MLLM 的开发建立了一个要求严格的新测试平台。