论文

VideoZeroBench:通过时空证据验证探索视频 MLLM 的极限

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

模型评测基准与评测资源

摘要

最近的视频多模态 大语言模型 在各种基准测试中取得了令人印象深刻的结果。然而,当前的评估存在两个关键局限性:(1)夸大的分数可能掩盖细粒度视觉理解和推理的缺陷,(2)通常在不验证模型是否识别支持其预测的精确时空证据的情况下测量答案的正确性。为了解决这个问题,我们提出了 VideoZeroBench,这是一个分层基准,旨在挑战长视频问答,严格验证时空证据。它包含 13 个领域的 500 个手动注释问题,并配有时间间隔和空间边界框作为证据。为了解开答案生成、时间基础和空间基础,我们引入了一个五级评估协议,逐步收紧证据要求。实验表明,即使 Gemini-3-Pro 在标准端到端 QA 设置(Level-3)下正确回答的问题也不足 17%。当施加基础约束时,性能急剧下降:当需要正确回答和准确的时空定位(5 级)时,没有模型的准确度超过 1%,大多数模型都无法实现任何正确的基础预测。这些结果暴露了表面答案正确性和真正的基于证据的推理之间的显着差距,表明扎根的视频理解仍然是长视频 QA 的瓶颈。我们进一步分析最小证据跨度、原子能力和推理范式的性能,为扎根视频推理的未来研究提供见解。基准和代码将公开。