论文
VidNum:诊断基于视频的数值推理中的 VLM 故障模式
VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning
摘要
基于视频的数值推理需要视觉语言模型 (VLM) 来识别、跟踪和组合跨帧、动作和场景变化的定量证据。现有的基准测试提供了碎片化的覆盖范围:一般的 VideoQA 包括更广泛的任务中的计数,而专用基准测试则侧重于重复计数、超长视频枚举或教学数学。我们推出 VidNum,这是一个手动策划且独立验证的基准测试,包含 1,167 个多项选择题。它的三个任务组分别是直接枚举和离散枚举、条件枚举和结构化枚举以及组合定量推理。问题级注释进一步识别证据目标、计数结构和所需的推理操作。评估最佳的 VLM 准确率达到 59.8%,而人类注释者的准确度为 98.2%,并且没有评估的开放权重模型超过 45%。分层分析表明,失败并不是均匀分布的:结构化目标构建和基于行动的组合推理形成了跨模型反复出现的瓶颈。零样本思维链提示并不是一种可靠的补救措施:它可以恢复一些错误,但会破坏之前的正确答案,其效果因模型和任务结构而异。因此,VidNum 支持超越单一总分的诊断分析。