论文
迈向野外空间超感知
Towards Spatial Supersensing in the Wild
摘要
人类可以有效地解析从几小时到几年的连续感官流,构建一个基于空间推理和预测的内部世界模型。为了模仿这种能力,空间超感知挑战多模态模型,使其超越语言理解,转向真实世界建模。然而,他们的基准依赖于由随机短片串联而成的合成长视频,并且大多仅限于家庭场景,而现实世界的连续性和多样性尚未得到充分探索。为了解决这一差距,我们引入了 $\textbf{VSI-Super-Wild}$,这是一个大规模基准,用于评估不同野外场景中长时间范围内的空间超感知。值得注意的是,受到人类如何构建体验的认知研究的启发,我们系统地探讨了世界状态的完整三元组:主体(观察者)、物体(场景项)和环境(地点和全局布局)。总的来说,VSI-Super-Wild 包含 $\textbf{6,980}$ 经人工验证的问题答案对,这些问题答案对源自 $\textbf{442}$ 跨越 8 个场景类别的真实世界视频,包括超过 4 小时的长格式录制。 VSI-Super-Wild 的结果暴露了一个根本性的脱节:尽管静态图像理解取得了进步,但模型在需要随着时间的推移进行一致的世界状态跟踪的任务上始终失败。我们描述了性能如何随着世界状态复杂性和时间范围而降低,并诊断了四种故障模式:空间崩溃、语义快捷方式、更新不足和实例混乱。这种分类法揭示了模型缺乏将对象、代理和环境绑定到统一空间世界模型中的机制,这是定义空间超感知前进道路的根本差距。