论文

FUSAR-R1:面向SAR图像智能解译的大规模推理模型

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

模型训练强化学习

摘要

近年来,大规模视觉—语言模型正推动遥感图像智能解译的范式转变。通过引入文本语义信息,解译模型的认知表达、语义理解与人机交互能力显著提升,在合成孔径雷达(SAR)图像解译领域取得初步进展。然而SAR图像受相干成像机制、复杂散射特性、斑点噪声干扰与目标—背景耦合等因素影响,图像特征复杂多变、不确定性与专业化程度高。现有SAR视觉—语言模型尚不具备人类专家的逐步分析、逻辑判断与自我纠错能力,难以支撑复杂场景下的可靠智能解译。为解决该问题,本文提出面向SAR图像智能解译的大规模推理模型FUSAR-R1。模型先模拟人类专家解译过程构建显式思维链推理数据,以其指导指令学习,赋予模型基础推理能力;随后引入强化学习策略,基于推理结果优化模型输出,实现自我纠错与更可靠的推理。实验结果表明,FUSAR-R1在目标检测、目标计数与分类、土地覆盖类别识别等多项SAR解译任务上持续优于现有多模态大规模模型。

FUSAR-R1:面向SAR图像智能解译的大规模推理模型:论文配图
图1:FUSAR-R1总体框架