论文

UAV-OVVIS:无人机也需要开放词汇视频实例分割

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

模型评测基准与评测资源

摘要

无人机视频广泛应用于交通监控、城市管理、应急救援等领域。然而,现有的无人机视频感知很大程度上仅限于预定义类别的盒级检测和跟踪,因此很难共同支持开放场景中时间动态的灵活查询和细粒度实例级理解。为此,我们引入了一项新任务,无人机开放词汇视频实例分割(UAV-OVVIS),其目的是根据开放词汇查询发现无人机视频中的目标,并输出具有全局一致身份的实例分割轨迹。考虑到无人机场景中实例级注释的稀缺性,我们提出了AeroTrack,一个无需训练框架,它协调现有的视觉基础模型以实现UAV-OVVIS。 AeroTrack 通过定期开放词汇检测和短段掩码传播来执行目标发现和分段,并引入生命周期感知 ID 关联 (LIA) 以在分段推理下恢复全局身份。基于该框架,我们实例化了五个可行的变体并构建了 AeroVIS,这是一个包含 9 个无人机目标类别和 8,279 个轨迹的 UAV-OVVIS 评估基准。实验表明,与评估的转移到 AeroVIS 的 OV-VIS 方法相比,AeroTrack 实现了更好的整体性能,同时在长无人机视频中展示了良好的开放词汇可转移性和密集目标处理能力。 AeroTrack 框架和 AeroVIS 数据集将在接受后开源。