论文
检测前先了解:全域红外小目标检测的视觉-语言学习
Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection
摘要
全域红外小目标(IRST)检测对于红外监视至关重要,但由于异构成像域和不一致的目标特征,仍然具有挑战性。以前基于深度学习的方法是针对纯视觉范例开发的,并在特定领域的任务上取得了有希望的性能。然而,现有的方法遵循特定任务的监督学习范式。这种范式将全场景红外观测简化为稀疏目标监督,丢弃了跨异构域保持不变的语义。因此,检测性能在域转移的情况下会受到很大影响。为了解决这个问题,我们引入了 \textbf{``在检测之前理解''},这是一种将全域 IRST 检测制定为理解驱动过程的范例,其中整体红外目标理解先于精确检测。在此范式的基础上,我们提出了 \textbf{JinSight},它首先通过语言监督开发整体 IRST 理解,然后将学习到的跨域表示转移到精确的小目标检测。通过将红外表示以语言语义为基础,JinSight 使单个模型能够泛化到异构红外领域。然后,我们引入潜在语义交互(LSI),它在紧凑的低秩空间中用细粒度的空间特征交换语言对齐的全局语义。为了解决缺乏多模式全域 IRST 基准的问题,我们构建了 \textbf{OmniIRST-VL},这是第一个用于全域 IRST 检测的大规模、高度多样化的视觉语言数据集。它包含超过 39,000 个注释,涵盖六个互补的指令任务,涵盖场景级理解和以目标为中心的推理。