论文

时间基准分数衡量什么?视频 VLM 评估中分解通道的使用

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

模型评测评测方法与指标

摘要

时间视频问答基准的分数旨在衡量模型是否具有时间理解能力,但它混淆了两个问题。 1. 任务问题:问题是否是时间性的,是否需要多个帧及其顺序? 2.通道问题,当出现这种情况时,模型是否从像素中恢复顺序,或者从位置编码(RoPE)中读取它?大多数时间分数都不会回答,单个帧和答案先验通常会携带它。该字段的有效性检查、帧洗牌敏感性以及从完整视频中获得的准确性仅涉及任务问题。我们为通道问题提供了一个无标签屏幕,即反转下降:当视觉序列反转而 RoPE 保持向前时,准确性会丢失。它可以应用于兼容的时间基准,而无需新的注释。成对的反向标签,或者其标签在反转下确定性转换的任务,可以将遵循反向内容的模型与仅仅受到冲突破坏的模型区分开来。 Molmo2 回答了位置之外的正向事件阅读顺序,而 Qwen3-VL 则回答了它实际看到的反向事件,阅读了视觉顺序(相对而言)。我们称它们为位置主导和视觉序列主导。这种分割适用于两个基准和两个尺度的多个时间任务,激活修补表明它是一个真正的内部属性,而不是冲突的产物。区别很重要,两个通道在相反的输入上失败,因此具有相似分数的两个模型不可互换,即总分数不反映潜在的失败模式。