论文

AeroGround:空地协同推理的综合基准

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

模型评测基准与评测资源

摘要

视觉语言模型(VLM)已广泛应用于无人机(UAV)的理解和推理任务。现有的无人机基准测试主要关注鸟瞰场景。然而,当前的 VLM 能否在空地协作场景中的理解和推理任务上表现良好,而这些任务在救援和基础设施检查等现实应用中是否实用,仍有待探索。为了弥补这一差距,我们引入了 AeroGround,这是一个用于评估空地协作推理中的 VLM 的综合基准。 AeroGround 基于模拟空地数据集,包含来自不同开放环境的约 29,000 个多模式观察组,并提供 2,250 个高质量问答实例,涵盖跨视图对应、空间理解和推理。对 16 个预训练的 VLM 以及两个领域适应变体进行的实验揭示了当前模型与人类表现之间的巨大差距:最佳模型的平均准确率达到 54.4%,而人类达到 93.3%。通过系统地揭示空地协同推理现有模型的优势和局限性,AeroGround 为开发功能更强大的空地协同具体智能系统奠定了基础。