先填补后进:针对场景专用遥感 MLLM 的能力差距驱动 后训练
Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs
摘要
遥感多模态 大语言模型 (RS-MLLM) 提高了对航空图像的一般理解。然而,对地观测应用需要细粒度的场景专业化,受到高质量场景数据稀缺和能力覆盖不完整的限制。我们将这种适应表述为能力差距驱动的 后训练 问题,并建议先填充再推进(FBA)。 FBA 不是依赖目标域样本上的单阶段监督 微调 (SFT),而是首先填补先决条件的能力差距,然后再推进场景专业化。我们通过构建CPRS(沿海港口遥感)来实例化用于沿海港口理解的FBA,这是一种代表性的多源场景,CPRS是一个三层监督数据集,加上三个有序阶段:(1)用于俯视视觉语言对齐的RS语义锚定; (2) 不同模式下跨目标和桥接场景的共享RS先验的域-桥接收敛; (3) 针对下游性能的基于证据的场景调整。我们构建了 HarborEval,一个涵盖感知、空间理解、鲁棒性和生成的八轨诊断基准。在可比较的训练预算下,HarborEval 在 LLaVA-v1.5 上从 Direct-SFT 的 57.95 增加到 FBA 的 70.29,在 Qwen3-VL 上从 81.09 增加到 83.37。 FBA 的性能也优于 Collapsed-SFT,并在与港口相关的 VRSBench/RSVQA 子集和 OpenEval 上领先。阶段性分析和角色替换分析验证了渐进式差距填补和特定阶段的角色。 CPRS、HarborEval、代码和训练权重的公共示例和发布更新可在 https://github.com/Z0ngL1ng/filling-before-advancing 上找到。