论文
RSJEV:多模态模型的判别式遥感分类
RSJEV: Discriminative Remote Sensing Scene Classification with Multimodal Large Language Models
摘要
遥感场景分类是对地观测和地理空间分析的一项基本任务。现有方法主要遵循三种范式:特定任务的视觉分类、视觉语言相似性匹配和自回归多模态生成。然而,视觉分类器依赖于预定义的标签空间,基于 CLIP 的方法通过静态图像文本对齐执行识别,多模态大语言模型 (MLLM) 为具有显式候选类别的分类任务引入了不必要的 token 级别生成。为了解决这些限制,我们提出了 RSJEV,一种用于遥感场景分类的一次性多模态决策框架。与将分类表述为自回归文本生成的传统 MLLM 不同,RSJEV 将场景分类重新表述为候选条件多模态判别决策过程,其中视觉表示、任务指令和候选类别语义被联合建模。具体来说,我们引入了 OnePass Decider,它提取多模态决策状态并直接估计候选类别空间内的类别概率,消除自回归解码,同时保留视觉语言交互。对三个广泛使用的遥感场景分类基准(包括 UC Merced、AID 和 NWPU-RESISC45)进行的大量实验表明,与代表性的基于 CNN、Transformer、Mamba、CLIP 和 MLLM 的方法相比,RSJEV 实现了卓越的分类性能。此外,RSJEV 显着降低了推理成本,并仅通过紧凑的 0.8B-参数模型实现了更好的精度与效率权衡。这些结果证明了状态条件多模态决策对于高效遥感图像理解的有效性。代码可在 https://github.com/Dongtcs/RSJEV. 获取
