论文

用于多光谱和 SAR 图像理解的通用 VLM 的轻量级改造

Lightweight Adaptation of General-Purpose VLMs for Multispectral and SAR Image Understanding

模型训练参数高效训练

摘要

通用视觉语言模型 (VLM) 现在支持强大的视觉识别、指令跟踪和生成。然而,大多数预训练的视觉编码器都是围绕三通道自然图像构建的,并不直接适应原生多光谱测量或合成孔径雷达 (SAR) 等观测结果。使 VLM 适应这些传感器通常需要专用编码器和域预训练,从而减慢了更强大的通用检查点的重用。我们证明通用 VLM 的多图像接口提供了一种轻量级的替代方案。我们的协议将每个观察结果呈现为五个光学视图和一个 SAR 视图,在提示中命名它们,并使用 LoRA 调整语言网络和选定的视觉 Transformer 块。这通过现有的可视化界面暴露了波段合成、光谱指数和雷达反向散射。对于土地覆盖识别,结构化监督结合传感器证据来预测类别。我们进一步构建偏好对,其中省略真实标签,同时保留其支持证据,鼓励与观察结果保持一致的完整预测。在源自 BigEarthNet-v2 的平衡六级土地覆盖基准上,改编后的 Qwen3-VL 达到 0.8275 micro F1。相同的输入和适应协议改进了所有四个经过测试的 VLM 架构,并传输到 Sen1Floods11 洪水验证和 BigEarthNet.txt 字幕。图像去除和失配控制表明,适应的模型使用提供的传感器观测结果。总之,这些结果表明,VLM 可以通过渲染输入和紧凑的 LoRA 适应重新用于多光谱和 SAR 任务,而无需训练新的基础模型。