论文
MonoIR-RS:采用 CLIP 和 VLM 适配的红外遥感视觉语言学习
MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
摘要
红外遥感图像可捕获 RGB 图像中通常不可见的强度结构、物体背景对比度和照明不变线索。然而,大多数遥感视觉语言资源和模型都专注于可见波段语义,而红外视觉语言理解尚未得到充分探索。我们介绍了 MonoIR-RS,这是一个大规模红外遥感视觉语言数据集和基准,它将红外感知数据构建与 CLIP 式对比适应和 VLM 指令调整相结合。 MonoIR-RS 采用相同的源池构建并与 FusionRS 分开,保留了红外图像作为面向模型的模式,生成 600,000 个合成红外图像和 59,032 个保留的红外感知图像描述记录。模型实验使用这个保留的语言监督子集,其图像描述重写了围绕灰度结构和红外风格对比度而不是 RGB 外观的监督。我们表明,与 AVIID 基准上的灰度转换相比,合成的红外图像明显更接近真实的热图像。我们微调了 5 个 CLIP 主干和 6 个 VLM 主干,并根据零样本行为对它们进行校准:IR 感知自适应将 CLIP 平均召回率提高了 12.8 点,并将 VLM 图像描述 IR 提示覆盖率提高到 100%,同时将残余 RGB 颜色泄漏减少到接近零。通过将红外模态与 RGB-IR 双模态学习隔离,MonoIR-RS 提供了一个受控、可重复的测试平台,用于将红外遥感证据与语言对齐。