论文

SkyVLaM:用于遥感中无人机视频理解的多模态 大语言模型

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 的最新进展显着提高了遥感 (RS) 多模态理解。语言条件分割对于无人机 (UAV) 视频中的细粒度目标理解至关重要。然而,由于小型、视觉模糊目标和动态空中视角的普遍存在,这项任务仍然具有挑战性。在本文中,我们提出了 SkyVLaM,一种用于无人机视频理解的多模态 大语言模型。 SkyVLaM 通过时间基础感知器直接从补丁级视频表示构建稀疏标记,规范稀疏基础以鼓励互补的时间线索,并自适应地选择时间相干的密集片段进行高分辨率检查。生成的稀疏和密集标记由 大语言模型 联合处理,以进行查询条件分割。我们进一步构建了 SkyVid,由 SkyVid-VGCG 和 SkyVid-RVOS 组成,分别用于视频基础对话生成和参考视频对象分割。 SkyVid 包含 101 个视频、33.6K 帧和 153 万像素级对象实例。实验表明,SkyVLaM 提供了更有效的视觉 词元预算 分配,并改进了无人机场景中的语言条件视频分割。