论文

KilometerVision:VLM 中大规模空间智能的新前沿

KilometerVision: A New Frontier for Large-Scale Spatial Intelligence in VLMs

模型评测基准与评测资源

摘要

我们推动了视觉语言模型 (VLM) 中大规模空间智能的前沿,并推出了第一个基准测试,该基准测试可从真实世界视频中探索地理布局理解,跨度可达 1 公里。受认知科学文献的启发,我们根据人类空间意识的分层阶段评估模型:通过地标进行锚定,通过路线将它们连接起来,并将它们整合到全球心理地图中。大量实验揭示了当前人工智能模型处理空间信息的方式存在根本差异。我们发现 VLM 几乎完全依赖 2D 视觉识别和文本匹配来绕过复杂的空间推理,而不是利用真正的路径集成或形成几何测量知识。该基准测试可在 https://perception-test-challenge.github.io/kilometervision.html. 上公开获取