论文

低频陷阱:视频语言模型难以完成简单事件记账

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

模型评测模型能力评测

摘要

现实世界的视频基准提供了广泛的覆盖范围,但固定的片段纠缠事件计数、速率、持续时间和视觉复杂性,使得故障模式难以隔离。虽然现有的程序化基准提供更好的控制,但它们只评分最终答案,而没有审计报告事件与可执行的真值对比。为了填补这一差距,我们引入了基于轨迹的参数化性能评估,用于事件计数在三个受控视频任务中:弹跳球与墙面的接触、视觉眨眼和类别状态转换。在2,190个视频上,我们改变事件计数N和频率F,同时保持渲染固定。每个视频都包括一个可执行的事件轨迹,用于能力表面估计和时间级别评估。我们的结果揭示了一个阶段性的时序失败。当可靠性阈值达到80%时,Gemini 3.6 Flash可靠地记录持续状态转换,最多12个事件以每秒0.5和1.0 Hz,但对瞬态闪烁事件,没有任何可可靠识别正事件数的区域。因此,事件表示决定了模型是否最初接触证据——随着计数和频率增加,这一限制变得更加明显。在高计数、高频率的情况下,最终计数中只有0.2%正确,模型仅恢复了18.1%的真实事件。为了测试视觉访问是否是主要瓶颈,我们提高了采样率。尽管这将弹跳球的准确度从19.6%提高到29.3%,但报告序列与真值一致的时间仅为3.7%。因此,额外的帧可以增加最终分数,而不产生忠实的事件恢复。不同的提示策略同样产生了类似的限制性收益,而现实世界的视频评估也显示了低事件计数时的成功集中度。最终,基于轨迹的性能评估从综合准确度指标转向对时序推理失败的详细诊断。

低频陷阱:视频语言模型难以完成简单事件记账:论文配图
图 1:基于迹线的参数分析概述。与基于单个聚合准确度分数的标准基准评估不同,我们的框架生成具有可执行事件跟踪的受控视频。