论文
用于流式航空视频中小物体理解的记忆增强多模态 大语言模型
Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos
摘要
语言引导的空中感知旨在理解复杂无人机(UAV)场景中用户指定的微小目标。在实际的无人机部署中,无人机必须在飞行时做出响应,因此这种感知以在线流的方式运行,其中帧按顺序到达,模型对每个帧做出响应,而无需访问未来的帧。然而,将当前的多模式 大语言模型 (MLLM) 应用于此设置会带来两个挑战。首先,从空中看到的目标通常很小,但现有 MLLM 中的视觉压缩会平等对待所有区域并丢弃其细粒度细节。其次,理解连续流需要过去的帧上下文,但在资源有限的机载硬件上保留整个历史记录是不可行的,而丢弃它会导致目标漂移或消失。我们从数据和方法的角度解决微小对象和流的挑战。从数据的角度来看,我们提出了 \textbf{DroneEyes},这是用于微小空中目标的 \textbf{first} 像素级和开放词汇引用分割数据集,其中包含 2,140段高清视频和 176,623组对象描述与指代表达任务对,以及密集的每帧掩码。从方法的角度来看,我们提出了 \textbf{SkyAnchor},这是一种针对上述挑战有两种设计的 MLLM:语义感知词元路由器,在简化的视觉 词元预算 下保留小目标,以及分层内存库,使目标在流上保持一致的理解。