论文

ESARBench:代理无人机具体搜索和救援的基准

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

智能体系统Agent任务评测

摘要

多模态 大语言模型 (MLLM) 的快速发展使无人机 (UAV) 具有空间推理、语义理解和复杂决策的卓越能力,使其天生适合无人机搜索和救援 (SAR)。然而,现有的无人机SAR研究以传统的视觉和路径规划方法为主,缺乏全面统一的实体基准。为了弥补这一差距,我们首先提出了\textbf{嵌入式搜索和救援(ESAR)}的新任务,该任务要求空中特工自主探索复杂的环境,识别救援线索,并推理受害者位置以执行明智的决策。此外,我们还推出了 \textbf{ESARBench},这是第一个综合基准测试,旨在在高度真实的 SAR 场景中评估 MLLM 驱动的无人机代理。利用虚幻引擎 5 和 AirSim,我们构建了四个直接从现实世界地理信息系统 (GIS) 数据映射的高保真、大规模开放环境,以确保逼真的景观。为了严格模拟实际救援行动,我们的基准测试结合了动态变量,包括天气条件、一天中的时间和随机线索放置。此外,我们根据真实救援案例创建了包含 600 个任务的数据集,并提出了一组可靠的评估指标。我们评估不同的基线,从传统的启发式到先进的基于 MLLM 的地面和空中 ObjectNav 代理。实验结果凸显了 ESAR 的挑战,揭示了空间记忆、航空适应以及搜索效率和飞行安全之间的权衡方面的关键瓶颈。我们希望 ESARBench 成为推进嵌入式搜索和救援领域研究的宝贵资源。源代码和项目页面:https://4amgodvzx.github.io/ESAR.github.io。