论文

MVVBench:跨视角与时间的四维视频推理

MVVBench: Benchmarking 4D Reasoning in Vision-Language Models

模型评测模型训练强化学习基准与评测资源RLVR

摘要

多视图视频理解需要跨多个通常不重叠的摄像机流集成空间和时间证据:在视点之间转换时跟踪实体,跨时间对齐事件,并推理潜在的 4D 连续性而不是任何单个可见帧。我们介绍 MVVBench,这是根据现实世界多摄像机数据集构建的多视图视频推理基准。问题被设计成沿着视图和时间轴都是单视角信息不足的:每个问题从指定输入集中的任何单个视图都无法回答,并且大多数问题从任何单个时刻都无法回答。只有通过跨视角和跨时间的联合推理,每个问题才能唯一解决。 MVVBench 跨越不同的动态场景,通过人工编写的 QA 和严格的验证,探索六种功能:隐式/显式属性识别、隐式/显式相对距离、相对相机姿势和组合计数。除了基准测试之外,我们还对当前视觉语言模型成功或失败的时间和原因进行了广泛的分析,描述了由于时间错误定位、跨视图身份中断和脆弱的多跳推理而导致的错误。然后,我们研究推理时间启发策略,释放潜在的多视图能力——特定于任务的思维链支架和结构化的跨视图证据聚合——无需再训练即可产生巨大的收益。最后,我们提出了初步证据,表明具有可验证奖励的强化学习可以在基础模型中引发一些潜在的多视图能力,表明训练时间方法是未来工作的一个有希望的方向。总之,MVVBench 提供了对 4D 多视图推理的严格评估,并为未来实现可靠的具身感知奠定了基础。