论文

使用光学视觉基础模型进行 SAR 目标识别的跨模态学习

Cross-modal learning for SAR target recognition using optical vision foundation models

模型训练监督微调与指令调优

摘要

合成孔径雷达 (SAR) 因其多功能、远距离和近乎全天候的操作能力而成为各种成像应用中的重要模式。然而,由于标记数据有限、SAR 图像中的强散斑以及 SAR 和更丰富的光学图像之间的显着域差距,自动目标识别 (ATR) 仍然是一个具有挑战性的问题。相比之下,电光 (EO) 图像受益于海量数据集、更清晰的视觉结构和强大的基础模型。在这项工作中,我们研究了在光学数据上训练的视觉基础模型如何为 SAR 分类提供类级监督。我们提出了一种跨模态 EO 到 SAR 原型对齐框架,其中基于 DINOv3 视觉基础模型的冻结 EO 编码器用于构建类级光学原型,而不需要严格的 EO/SAR 对。然后训练 SAR 模型对 SAR 图像进行分类,同时将其嵌入与相应的 EO 类原型对齐。在推理时,SAR 模型独立运行,无需访问光学图像。我们在 UNICORNv2 数据集上评估我们的方法,该数据集是民用车辆的 EO 和 SAR 数据集,具有严重的斑点图像和严重的类别不平衡。 EO 原型对齐比冻结的 DINOv3、仅 SAR 微调和不成对的分布对齐基线提高了 SAR 分类精度,并且 t-SNE 可视化提供了经过训练的 SAR 嵌入空间中类之间更清晰分离的定性证据。这些结果表明,光学视觉基础模型尽管是在可见光谱图像上进行训练的,但仍为 SAR 图像分类提供了可转移的信息,为在具有挑战性的传感模式中使用大规模预训练视觉基础模型提供了实用方法。