论文

了解十亿像素级的动态场景:无人机的广域时空感知

Understanding Dynamic Scenes at Gigapixel Scale: Wide-Area Spatio-Temporal Perception from UAVs

模型评测基准与评测资源

摘要

无人机成像技术已从百万像素传感器发展到十亿像素传感器,将空中感知从识别单个目标转变为理解整个动态场景。我们将这种需求描述为广域时空场景理解(WSTU),它需要广域覆盖、每目标分辨率和时间连续性,而这是现有数据集所缺乏的组合。为了填补这一空白,我们引入了超高分辨率(12768x9564)机载遥感数据集(HARD),该数据集在三个级别上进行注释,用于对象检测、多对象跟踪和场景级视觉问答。超高分辨率图像将每帧处理时间提高到几秒。在这种规模下,评估中不能再忽略延迟。因此,我们提出了一种用于多对象跟踪的延迟感知指标,称为流式 HOTA (s-HOTA)。广泛的基线实验展示了超高分辨率处理如何重塑每项任务。对于检测而言,端到端管道对精度和速度的影响与检测器本身的影响一样大。对于跟踪来说,高延迟对关联轴的收费比对检测轴的收费更加不均匀,而关联是管道发散的地方。因此,离线表现最佳的管道可能会在 s-HOTA 下失去领先地位。对于 VQA 来说,视觉语言模型在跨框架身份绑定方面仍然很弱,无法将其单帧收益转移给它。这些发现共同表明我们评估的基线未达到 WSTU。 HARD 提供了数据和系统基线来推进它。