论文
事半功倍:采用简单配方的大规模遥感 VLM
More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe
摘要
人们越来越期望遥感视觉语言模型能够支持对地球观测数据和各种任务的开放式推理。该领域的最新进展是由遥感特定的架构设计推动的,通常引入新的编码器、对齐模块或特定于任务的融合机制。在这项工作中,我们挑战了这种建筑专业化的必要性。我们证明,只要在不同的数据和任务上进行足够规模的训练,一个通用的视觉语言模型就可以在具有挑战性的遥感基准上实现有竞争力或最先进的性能。我们的模型使用单一语言策略,可以直接以文本形式回答,也可以调用本地化工具进行分段和基础。为了训练这种异构行为,我们采用了多任务强化学习框架,该框架具有自适应任务奖励,涵盖多种输入类型的多项选择 VQA、自由形式 VQA、图像描述、检测和分割。我们的方法在一系列广泛的基准测试中取得了有竞争力的结果,包括高分辨率、多时态、多模式和多视图任务。此外,随着训练数据的规模扩大,我们的实验表明,无论分布内还是分布外,大多数任务都有一致的改进,这与每个任务的数据多样性相关。这些发现表明,对于遥感 VLM,即使没有新颖的架构,数据规模也足够了。