论文

RRS-10K:面向稀有遥感影像解译的多任务视觉-语言模型基准

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

模型评测基准与评测资源

摘要

视觉-语言模型(VLM)在通用遥感任务上已取得强劲表现。然而,它们在稀有场景上的能力仍了解不足,因为现有基准以常见的城市和乡村影像为主。为填补这一空白,我们提出RRS-10K,一个面向稀有遥感影像解译的基准。RRS-10K包含10,738张军事相关遥感影像及对应的多格式问答对,用于全面评估。所有影像均收集自一手来源,并被组织为三个能力维度、六个子维度和20个叶子任务,覆盖感知、推理和鲁棒性。为提高多选题质量,我们在基准构建过程中引入基于相似度的干扰项过滤策略(SDFS)。我们进一步评估了52个代表性模型,结果显示当前VLM在稀有遥感影像解译上的零样本表现仅属中等,在视觉定位、指代分割和复杂语义推理任务上存在明显弱点。RRS-10K支持对长尾遥感解译失败模式的系统性分析,并为开发更可靠的遥感VLM提供指导。

RRS-10K:面向稀有遥感影像解译的多任务视觉-语言模型基准:论文配图
图 3:RRS-10K 基准构建概述。所有遥感图像均来自公开数据集,并经过严格的质量控制流程,包括手动验证和 VLM 辅助验证。