Earth-OneVision:将遥感多模式 大语言模型 扩展到更多传感器模式和任务
Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks
摘要
RS-MLLM 可实现对地球观测图像的自然语言理解和空间推理。然而,现有模型仅支持范围狭窄的传感器类型和任务,从而产生了支离破碎的地球视图,并且跨模式的地球科学知识在很大程度上未得到利用。这项工作提出了 Earth-OneVision,这是一种 2B RS-MLLM,它在单个自回归框架内统一了六种传感器模式(即光学、SAR、红外、多光谱、时间和视频)和跨 9 个任务类别的跨传感器融合。三种专用机制解决了三个瓶颈。全粒度视觉语言对齐(FGVLA)将多级视觉特征与多维语言空间对齐。空间语言同构序列化 (SLIS) 将异构空间输出统一为自回归标记。渐进式跨模态适应 (PCMA) 将复合域间隙分解为连续阶段,依次解决视点和成像物理间隙。为了支持联合训练,MMRS-OneVision 由约 34M QA 对构建,涵盖所有六种传感器模态和跨 9 个任务类别的跨传感器融合,大大超过了现有的 RS 多模态指令数据集。仅凭借 2B 参数,Earth-OneVision 在广泛的基准测试中就取得了具有竞争力或最先进的结果,始终匹配或优于 4B-72B RS-MLLM。它在光学视觉视觉定位的 OPT-RSVG 测试集上实现了 87.52% P@0.5,在 SAR VQA 基准 SARLANG-Bench 上实现了 80.68%,比 7B 模型高出 7% 以上。它还在用于多光谱分类的 BigEarthNet-MS 测试集上实现了 75.74% 的召回率,在用于跨模态推理的 EarthMind-Bench 上实现了 81.94% 的 MCQ 准确率。