论文
VISTA:视频交互时空分析基准
VISTA: Video Interaction Spatio-Temporal Analysis Benchmark
摘要
视觉语言模型 (VLM) 的现有基准主要评估对简单单动作视频、封闭属性集和受限实体类型的时空理解,未能捕获表征现实世界视频理解的不同实体之间的自由形式、多动作交互。此外,缺乏跨互补时空轴分析模型故障的系统框架阻碍了综合评估。为了解决这些差距,我们引入了 VISTA,这是一种视频交互时空分析基准,专为 VLM 中的开放集、多实体和多动作时空理解而设计。 VISTA 将视频分解为可解释的实体、其相关动作和关系动态,从而实现多轴诊断和对关系、空间和时间理解的统一评估。我们的基准测试将多个数据集集成到一个交互感知分类中,并包含约 12K 个跨越不同场景和复杂性的精选视频查询对。我们在 VISTA 上系统地评估了 11 个最先进的 VLM,并分解了整个分类的总体性能,以揭示传统指标所掩盖的缺点和明显的时空偏差。通过对具有挑战性的数据集提供详细的、分类驱动的诊断,VISTA 提供了一个细致入微的框架来指导模型设计、预训练策略和评估协议的进展。总体而言,VISTA 是第一个用于 VLM 时空理解的大规模、交互感知的诊断基准。