论文

EgoExo-Next:视觉选项下一状态和跨视图推理的视觉语言模型基准测试

EgoExo-Next:Benchmarking Vision-Language Models on Visual-Option Next-State and Cross-View Reasoning

模型评测基准与评测资源

摘要

视觉语言模型(VLM)越来越多地针对以自我为中心和跨视图视频推理进行评估,但现有基准主要关注语义事件理解、时间关系或已观察到的视图之间的对应关系,从而使它们直接推理未来视觉状态的能力尚未得到充分探索。我们引入了 EgoExo-Next,这是一种用于动态视觉状态推理的视觉选项基准,其中模型必须识别观察到的动作轨迹随后如何出现,而不是仅预测动作标签或文本描述。 EgoExo-Next 包含来自 6 个公共自我中心和自我-exo 视频源的 2,503 个人工策划的四选题,并包含四个相互关联的子任务,用于评估自我中心的下一状态预测、双向自我-exo 状态对应、外中心下一状态预测及其在 Ego-to-Exo Next-State 中的组成。对专有、开源和空间推理VLM的广泛评估揭示了人类与模型之间的巨大差距,最佳模型的平均准确度为 43.81%,而人类的平均准确度为 98.55%,并且最大的退化发生在组合的 Ego-to-Exo 任务上。这些结果表明,当前的VLM在动态视觉状态推理中仍然受到很大限制,特别是当必须组合时间进展和交叉视图推理时。该基准可在 \url{https://huggingface.co/datasets/yutongli2024/EgoExo-Next} 上公开获取。