论文

通过枚举和计数诊断多模态 LLM 中的长视频定量推理

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

模型评测基准与评测资源

摘要

最终答案视频 QA 可以显示模型是否预测了正确的数字,但不能显示它计算了哪些实例、支持证据何时出现或失败的原因。我们通过三种耦合能力来诊断多模态 大语言模型 (MLLM) 中的长视频定量推理:枚举与查询相关的实例、临时支持证据以及将证据聚合为计数。为了支持这一分析,我们构建了 EC-Bench,这是一个带有证据注释的评估套件,包含 152 个长度超过 30 分钟的未剪辑视频、跨越六个推理类别的 1,699 个开放式查询以及经过人工验证的证据跨度。我们使用带时间戳的视觉帧和转录本评估 22 个开源和专有 MLLM。最好的平均得分仅达到 29.98% 的计数 F1 和 23.74% 的计数准确度,而人类的表现分别为 78.57% 和 82.97%。我们的分析表明,计数错误很少是孤立的算术错误:计数 F1 与计数准确性密切相关,时序定位质量与较低的计数错误相关,并且随着支持证据变得更加分散,计数准确性会下降。这些发现将长视频计数重新定义为证据检索、时序定位、重复数据删除和视频聚合,而不是简单的数值预测。