视觉语言模型可以从空中思考吗?统一无人机推理和生成
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
摘要
视觉语言模型在地面视觉理解方面取得了长足的进步,但在高空无人机场景中仍然很脆弱,其中物体微小且密集,纹理重复,自上而下的方向不明确。我们引入了 UAVReason,这是一个大型无人机原生数据集和评估套件,用于研究这种最低视图域转移下的统一空中推理和生成。 UAVReason 在一致的航域内对齐 RGB 图像、深度图、语义分割掩模、图像描述和问答对。它包含 23.6K 个带图像描述的帧、273K 个 VQA 对(包括 68.2K 个两帧时间问题)以及 188.8K 个跨 RGB、深度和分割模态的跨模态生成样本。我们进一步采用 UAVReason-Bagel 作为统一的理解和生成基线,共同优化语言推理和密集的视觉生成目标。实验表明,通用 VLM 和现成的统一生成器在无人机场景中的视觉定位方面遇到了困难,而 UAVReason-Bagel 比预训练的同类产品有了大幅改进,将 VQA-1F F1 从 0.394 增加到 0.711,VQA-2F F1 从 0.427 增加到 0.822,航向感知 VQA F1 从 0.798 增加到 0.973。对于生成,它将深度分割文本条件 RGB 合成的分割 mIoU 提高到 0.143,并将 KID 从 0.078 降低到 0.048。更重要的是,我们的消融揭示了综合和推理之间的双向协同作用。密集生成目标提高了时间语义一致性,而语言级推理则规范了稀疏条件图像合成。这些结果表明,统一推理和生成为与物理环境对齐的空中感知提供了有效的几何感知结构先验。所有数据、代码和评估工具都将被发布。