论文
VLM 在天空和太空之间迷失了吗? LinkS$^2$无人机卫星动态交叉视角空间智能基准
Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence
摘要
无人机和卫星之间的协同空间智能对于应急响应和安全行动是不可或缺的,因为它独特地将宏观全球覆盖与动态、实时本地感知相结合。然而,视觉语言模型(VLM)掌握这种复杂相互作用的能力在很大程度上仍有待探索。这种差距之所以持续存在,主要是因为现有基准仅限于孤立的无人机 (UAV) 视频或静态卫星图像,未能评估对于全面交叉视图推理至关重要的动态局部到全局空间映射。为了弥补这一差距,我们引入了 LinkS$^2$Bench,这是第一个旨在评估 VLM 的广域、动态跨视图空间智能的综合基准测试。 LinkS$^2$Bench 将 1,022 分钟的动态无人机镜头与覆盖 200 多公里的高分辨率卫星图像连接起来$^2$。通过 LMM 辅助的流程和严格的人工注释,我们构建了 17.9k 个高质量问答对,其中包括跨越四个维度的 12 个细粒度任务:感知、定位、关系和推理。对 18 个代表性 VLM 的评估揭示了与人类基线相比的巨大差距,将准确的跨视图动态对齐确定为关键瓶颈。为了缓解这个问题,我们设计了一个跨视图对齐适配器,证明显式对齐可以显着提高模型性能。此外,微调 实验强调了 LinkS$^2$Bench 在推进 VLM 适应复杂空间推理方面的潜力。