论文
AirGroundBench:探索异构多视图体现协作下多模态大型模型的空间智能
AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
摘要
近年来,多模态 大语言模型 (MLLM) 在体现智能方面表现出了强大的潜力,但它们在异构视图中保持几何一致的空间理解的能力仍然被低估。现有的基准主要集中在单代理、单视图感知上,在空地协作设置的系统评估中留下了空白,其中多尺度观测是互补的,但会引入尺度不匹配、不对称遮挡和参考系不一致的情况。我们推出了 AirGroundBench,这是一个用于评估异构 UAV-UGV 协作中的多视图空间智能的诊断基准。 AirGroundBench 由 11 个高保真模拟环境和 1,021 个同步空地观测对构建而成,产生约 62,000 个双视图、四选项单选视觉问答实例和 115 个闭环视觉语言导航片段。它涵盖了 10 种任务类型,分为四个逐渐要求的能力维度:空间感知、跨视图对齐、空间变换和推理以及具体决策。为了支持基于几何的评估和分析,我们提供结构化空间注释,包括跨视图对象标识以及度量 2D 和 3D 边界框。对仅 UAV、仅 UGV 和双视图输入设置下的 13 个代表性 MLLM 的评估揭示了一致的瓶颈:模型在空间感知方面表现相对较好,但在跨视图对齐和转换密集型推理方面遇到困难,并且这些缺陷会传播到视觉语言导航中的顺序决策。尽管双视图输入比单视图变体提供了可测量的增益,但与人类表现之间的持续差距仍然存在,这凸显了几何一致性是当前具体化 MLLM 的一个关键限制。