论文

认识自我,了解世界:MLLM 无人机时空推理的双重认知基准

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 在不同的视觉语言任务中取得了出色的性能,但其在无人机场景中的功能尚未得到充分开发。最近面向无人机的基准测试已经开始评估空中场景中的 MLLM,但它们通常侧重于场景理解、事件识别或导航完成,而不是联合评估无人机代理所需的双重认知能力:在多视图时空背景下推理无人机自身状态和外部环境。为了解决这一差距,我们提出了 UAV-DualCog,这是基于这种双重认知视角的空中多视图时空推理的基准。 UAV-DualCog 包括图像和视频任务,以联合评估自我状态和环境状态推理,同时需要超越离散答案预测的空间或时间基础。我们还开发了一个自动化管道,可以从场景级语义点云构建数据,从而生成具有不同场景、数百个地标和数千个 QA 样本的可扩展基准。广泛的评估表明,当前的 MLLM 在无人机双重认知方面仍然远不可靠。自我状态推理、视点转换、精确的空间基础和时间间隔定位是持续存在的瓶颈,并且通过思维/前沿模型和人类基线进行额外验证,确认该基准对于人类来说是可以理解的,但对现有模型来说具有挑战性。我们进一步从不相交的场景构建 UAV-DualCog-Train,并通过轻量级优化探针表明它提供了有用的结构化监督,这表明它不仅作为评估基准,而且作为推进基于 MLLM 的无人机代理的数据资源的价值。项目网站及补充材料:https://uav-dualcog.lozumi.com