论文
RRS-10K:面向稀有遥感影像解译的多任务视觉-语言模型基准
RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation
摘要
视觉-语言模型(VLM)在通用遥感任务上已取得强劲表现。然而,它们在稀有场景上的能力仍了解不足,因为现有基准以常见的城市和乡村影像为主。为填补这一空白,我们提出RRS-10K,一个面向稀有遥感影像解译的基准。RRS-10K包含10,738张军事相关遥感影像及对应的多格式问答对,用于全面评估。所有影像均收集自一手来源,并被组织为三个能力维度、六个子维度和20个叶子任务,覆盖感知、推理和鲁棒性。为提高多选题质量,我们在基准构建过程中引入基于相似度的干扰项过滤策略(SDFS)。我们进一步评估了52个代表性模型,结果显示当前VLM在稀有遥感影像解译上的零样本表现仅属中等,在视觉定位、指代分割和复杂语义推理任务上存在明显弱点。RRS-10K支持对长尾遥感解译失败模式的系统性分析,并为开发更可靠的遥感VLM提供指导。
