论文
面向航空MLLM智能体的零样本任务级评估
Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents
摘要
多模态大语言模型(MLLM)正成为具身智能体的核心推理模块,然而通用模型能否仅凭单条高层指令解决长时程具身任务仍不清楚。我们提出 MissionBench,一个在航空 3D 环境中对 MLLM 进行任务级评估的基准。它包含横跨五个仿真 3D 环境和四个任务族的 120 个任务。智能体必须仅凭自我中心观测和自身动作历史自主规划、导航并汇报结果,且不进行航空领域特定微调。在 22 个开源与闭源 MLLM 上,最强模型的任务成功率不足 35%,而人类达到 84.4%,凸显了多步具身任务的难度。尽管模型家族之间存在巨大差异,我们观察到规模带来的收益,表明更大的通用模型拥有更强的零样本具身能力。我们的分析表明,任务级能力需要在空间感知之外协调多种能力,包括多步规划与自适应推理。这为闭环评估提供了动机,并同时揭示了规模化驱动改进对具身 AI 的前景与风险。
