论文
TempCloze:Video-LLM 能否识别缺失的中间部分?
TempCloze: Can Video-LLMs Identify the Missing Middle?
摘要
Video-LLM 的时间推理基准通常由语言调节,为选项措辞、答案相关性或语言先验的语言捷径留下了空间。为了减少这种捷径,我们引入了 TempCloze,这是一个视频完形填空基准,用于评估 Video-LLM 中的视觉时间推理。给定视频的开始和结束剪辑,模型必须从四个候选者中识别出真正缺失的中间部分。 TempCloze 包含来自七个来源的 1,521 个经过精心过滤的视频,主要是长镜头和以自我为中心的视频。我们沿着三个维度构建同源干扰项:语义询问应该发生什么事件,对齐探测事件应该何时发生,进展测试事件应该如何展开,而共享场景和对象则减少外观线索。我们对 10 个专有视频和 21 个开源 Video-LLM 的评估表明,对齐是主要瓶颈:模型通常可以识别合理的语义内容和本地事件进展,但很难处理时间对齐。我们进一步使用四个代表性模型对 TempCloze-Mixed 和 TempCloze-Hard 进行错误模式和行为敏感性分析,以检查错误出现的位置以及候选顺序、上下文方向、可见跨度、帧密度和测试时间缩放如何影响模型选择。