论文
遥感持续视觉语言学习:基准测试和分析
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
摘要
当前的遥感视觉语言模型(RS VLM)在图像解释方面表现出令人印象深刻的性能,但依赖静态训练数据,限制了它们适应不断出现的传感模式和下游任务的能力。这暴露了一个根本性的挑战:使 RS VLM 能够不断适应,而不会发生灾难性的遗忘。尽管 RS VLM 的持续学习能力具有实际重要性,但其持续学习能力仍未得到充分开发,目前尚不存在专门的基准。在这项工作中,我们提出了 CLeaRS,这是遥感中持续视觉语言学习的综合基准。 CLeaRS 包含 10 个精选子集,包含超过 207k 个图像文本对,涵盖不同的解释任务、传感模式和应用场景。我们进一步定义了三种评估协议:长视野、模态增量和任务增量设置,以系统地评估持续适应。对不同视觉语言模型的广泛基准测试揭示了所有设置中的灾难性遗忘。此外,当适应 RS VLM 时,代表性的持续学习方法在处理任务、指令和模态转换方面表现出有限的有效性。我们的研究结果强调需要开发适合 RS VLM 的持续学习方法。