论文

PushupBench:您的 VLM 不擅长计算俯卧撑次数

PushupBench: Your VLM is not good at counting pushups

模型评测基准与评测资源

摘要

大型视觉语言模型 (VLM) 可以识别视频中发生的 \textit{什么},但无法计算 \textit{多少} 次。我们引入 \textbf{PushupBench},446 个长格式剪辑(平均 36.7 秒)用于评估重复计数。最佳前沿模型准确率达到42.1%;开源 4B 模型得分 $\sim$6\%,与监督基线匹配。我们表明,仅准确性会产生误导——较弱的模型利用模态计数而不是临时推理。 微调 对 1k 样本的计数转移到一般视频理解:MVBench (+2.15)、PerceptionTest (+1.88)、TVBench (+4.54),表明计数是更广泛的时间推理的代理。PushupBench 并入 \texttt{lmms-eval} (https://github.com/EvolvingLMMs-Lab/lmms-eval/pull/1262)并托管在 (pushupbench.com/)