论文
推进基于 MLLM 的无人机图像理解和推理:基准和 无需训练 多智能体系统
Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
摘要
基于多模态 大语言模型 (MLLM) 的无人机航空图像理解和推理对于航空情报至关重要,但由于极端尺度变化、任意相机方向和高物体密度而带来了明显的挑战。尽管人们的兴趣日益浓厚,但现有的评估仍然分散在各个数据集和狭窄的任务中,从而在无人机理解和推理能力的统一评估方面留下了重大差距。为了填补这一空白,我们构建了 UAVQA-Bench,这是一个由来自 13 个公共无人机数据集的 1,500 个人工注释的 QA 对组成的基准,涵盖了多项选择和视觉基础格式的 6 个能力维度和 16 个任务。对 UAVQA-Bench 上的各种开源和闭源 MLLM 以及基于代理的系统进行系统评估,确定了三种关键故障模式:领域工具集不匹配、未经检查的错误传播和静态推理。受这些发现的启发,我们提出了 UAV-MAS,一种用于基于 MLLM 的无人机航空图像理解和推理的 无需训练 多智能体系统,包括将查询路由到适合任务的视觉工具的特定领域感知引擎(DSPE)、验证中间推理以抑制错误积累的上下文感知迭代细化模块(CAIR)以及调整难度感知自适应搜索机制(DAAS)。搜索深度来确定问题的难度。配备 32B 开源 MLLM 的 UAV-MAS 在 UAVQA-Bench 上实现了 77.0% 的总体准确率,比 Gemini 3 Pro 提高了 4.0%,而 8B 变体比其基本模型提高了 8.7%。