论文

AerialDojo-200K:开放世界空中物体目标搜索的大型基准套件

AerialDojo-200K: A Large-Scale Benchmark Suite for Open-World Aerial Object-Goal Search

智能体系统Agent任务评测

摘要

开放世界空中物体目标搜索是一项基础但具有挑战性的任务,要求空中Agent自主探索大规模、非结构化的三维环境并到达由语义描述或参考图像指定的目标物体,而不是遵循特定于路线的指令。然而,这项任务的研究仍处于初级阶段,依赖于具有异构行动空间和数据格式的小型、特定于环境的基准。这些限制阻碍了大规模训练和跨基准评估,限制了空中Agent的可扩展性和通用性。为了解决这个问题,我们提出了 AerialDojo-200K,这是一个用于开放世界空中物体目标搜索的大型基准套件,其场景数量和任务实例数量是该任务现有最大基准的 3 倍和 18.7 倍。具体来说,我们构建了 42 个模拟场景,涵盖 4 个场景系列和 21 个场景类型,其中包括 18 个城市场景、12 个自然场景、6 个基础设施场景和 6 个灾难场景。为了确保数据质量,12 位注释者花了两个月的时间手动注释了这些场景中的 109 个地标、2099 个目标对象和 2099 个对象锚点。我们进一步构建了 205,732 个任务实例,包括跨 Base、Standard 和 Long-Horizo​​n 设置的超过 100K 语义目标和超过 100K 图像目标实例。每个任务实例包括无碰撞参考轨迹和相应的多视图视频记录。我们还开发了一个统一的评估框架,其场景划分包括 21 个分布内场景和 21 个分布外场景。最后,我们对五个开源和四个闭源多模态大语言模型的评估表明,实现通用空中Agent还有很长的路要走。全部可以在https://fengtt42.github.io/AerialDojo/.找到