论文

有什么问题?评估视觉语言模型中的时间一致性

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在视频和图像序列基准上取得了出色的性能,但仍不清楚它们是否捕获时间结构。为了研究这个问题,我们将时间基础制定为异常检测问题,提供简单且受控的评估,直接测试对时间一致性的敏感性。我们引入了 TimeCatch,其中通过交换连续帧来创建时间异常,并通过用高斯噪声替换帧来创建帧级异常。在人类研究的同时,对四个合成数据集和真实世界数据集的异常检测和定位任务的模型进行评估。我们的评估揭示了帧级异常检测和时间异常检测之间存在巨大差距。虽然 VLM 始终如一地检测帧级异常并经常准确地定位它们,但在我们的主要评估设置下,它们通常在时间异常检测上表现接近机会,并且显示出有限的定位性能。相比之下,人类在这两项任务上的表现都接近上限。跨模型尺度、提示策略、序列长度和视觉相似性的额外分析表明,在某些条件下,性能可以提高,但时间异常检测和定位方面仍然存在巨大差距。总之,这些发现揭示了帧级异常检测和时间异常检测之间的差距。 TimeCatch 提供了一个用于评估视觉语言模型中时间一致性的受控基准。