论文

CVSBench:跨视图空间推理和梦想的综合基准

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

模型评测基准与评测资源

摘要

人类可以毫不费力地推理不同视点的场景,但目前尚不清楚视觉语言模型(VLM)是否具有类似的跨视图空间能力。卫星街道场景对及其复杂的环境和极端的视点变化提供了一个理想的测试平台。受此启发,我们引入了 CVSBench,这是一个通过卫星-街道对评估跨视图空间推理的大型基准。该基准测试支持多种任务,包括跨视图 VQA、跨视图定位和视点识别。 CVSBench 包含 3,297 个跨视图图像组,以及 9,468 个对象级注释和 40,679 个问答 (QA) 对,从而能够对跨视图空间推理进行系统且受控的评估。广泛的评估表明,先进的 VLM 很难在剧烈的视点变化下保持对象级别和布局的一致性。为了弥合与类人空间认知之间的差距,我们研究了两类方法:基于空间的推理和认知图输入的结合。我们的研究结果表明,纯语言推理只能带来微小的改进,而通过 3D 场景想象管道结合视觉空间想象力则可以显着改善跨视图推理。这些结果强调了显式视觉空间表示对于 VLM 中稳健的空间认知的必要性。我们的数据和代码发布于 https://huggingface.co/datasets/zlyzlyzly/CVSBench。