论文

缺少视觉证据的准确率:诊断视频中的视觉依赖性分离 LLM 基准测试

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

模型评测评测方法与指标

摘要

视频 大语言模型 (LLM) 中的基准准确性通常被视为视觉理解的证据。我们在涵盖 2-78B 参数和 10 个架构系列的 20 个模型中审核了这一假设。我们引入了视觉依赖性差距(VDG),即原始视频和黑屏条件下每个问题正确性的差异。 MVBench 上的配对 McNemar 测试表明,准确性和视觉依赖性是可分离的:模型在原始视频上有所不同 (p = 0.0003),但在黑屏上则不然 (p = 0.53)。在各个模型中,任务类型排名是稳定的:属性感知具有强烈的视觉效果,而时间推理则接近纯语言基线。从黑屏到单帧、混洗帧和原始视频的诊断阶梯表明,帧多样性提供了大部分视觉优势,而时间顺序在 16 个开放权重模型中贡献了接近零的准确性。从 0.5 FPS 到 24 FPS 的消融排除了稀疏采样的原因。 H.264 实验进一步表明,稳定的聚合精度掩盖了双向问题级答案翻转。该诊断还推广到四个 API 访问模型,其 VDG 值范围为 0.025 到 0.315。这些结果促使 VDG 作为视频基准是否衡量依据视觉证据判断的能力的标准审核。代码可在 https://github.com/JaeLee18/accuracy-without-grounding 获取。