论文

GST-Bench:VLM 能否通过视频培养全球空间意识?

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

模型评测基准与评测资源

摘要

空间智能是实体智能体的基础,但现有的基准侧重于从单一或少数几个角度的局部空间感知,忽视了连续、长视野视觉流的全局空间感知。为了解决这一限制,我们引入了全球空间时间基准(GST-Bench),这是视频理解中全球空间智能的 VQA 基准,包括从 6,790 分钟的合成视频中得出的经过人工验证的问题。它要求模型从输入视频中未见过的新视点执行准确的空间推理,并将以自我为中心的观察映射到全局自上而下的图像上。对 22 个最先进的 VLM 的综合评估揭示了模型与人类之间的巨大差距:最强的零样本模型仅获得 42.68,远低于人类的 79.08 分。为了探究这种差距的原因,我们构建了 GST-Bench-Local 并发现,尽管模型在相同的任务制定下具有很强的局部空间理解,但仍然无法将长视野观察整合为全局一致的场景表示。我们进一步提供 GST-Train(全球空间推理数据集)作为补充资源,以促进未来针对这一挑战的研究。