论文
VGenST-Bench:通过主动视频合成进行时空推理的基准
VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis
摘要
时空推理是在现实世界中运行的多模态 大语言模型 (MLLM) 的核心功能。因此,对其进行精确评估已成为一项重要挑战。然而,现有的时空推理基准数据集主要依赖于静态图像集或被动策划的视频数据,这限制了细粒度推理能力的评估。在本文中,我们介绍了 VGenST-Bench,这是一种视频基准测试,它采用生成模型来主动合成高度受控和多样化的评估场景。为了构建 VGenST-Bench,我们提出了一个包含人工质量控制阶段的多智能体管道,确保所有生成的视频和 QA 对的质量。我们建立了全面的 3x2x2 视频分类法,包括空间尺度、视角和场景动态,以跨越不同的场景。此外,我们设计了一个分层任务套件,将低级视觉感知与高级时空推理分离。通过将范式从被动管理转变为主动合成,VGenST-Bench 能够对 MLLM 中的时空理解进行细粒度诊断。