论文

面向航空MLLM智能体的零样本任务级评估

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

多模态大语言模型(MLLM)正成为具身智能体的核心推理模块,然而通用模型能否仅凭单条高层指令解决长时程具身任务仍不清楚。我们提出 MissionBench,一个在航空 3D 环境中对 MLLM 进行任务级评估的基准。它包含横跨五个仿真 3D 环境和四个任务族的 120 个任务。智能体必须仅凭自我中心观测和自身动作历史自主规划、导航并汇报结果,且不进行航空领域特定微调。在 22 个开源与闭源 MLLM 上,最强模型的任务成功率不足 35%,而人类达到 84.4%,凸显了多步具身任务的难度。尽管模型家族之间存在巨大差异,我们观察到规模带来的收益,表明更大的通用模型拥有更强的零样本具身能力。我们的分析表明,任务级能力需要在空间感知之外协调多种能力,包括多步规划与自适应推理。这为闭环评估提供了动机,并同时揭示了规模化驱动改进对具身 AI 的前景与风险。

面向航空MLLM智能体的零样本任务级评估:论文配图
图 1:MissionBench 在四个任务系列中评估 MLLM 的任务级空中推理:报告、检查、操纵和巡逻以及五种类型的环境。每集都以一个自然语言指令开始。然后,代理必须迭代地决定去哪里、如何定位自己以及报告什么结果以完成任务。