论文

预训练在哪里?研究预训练数据多样性如何影响地理空间基础模型性能

Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance

模型训练预训练

摘要

新的地理空间基础模型引入了新的模型架构和预训练数据集,通常使用不同的数据多样性概念进行采样。性能差异很大程度上归因于模型架构或输入方式,而预训练数据集的作用很少被研究。为了解决这一研究空白,我们对预训练数据的地理组成如何影响模型的下游性能进行了系统研究。我们创建了全球和每个大陆的预训练数据集,并在全球和每个大陆的下游数据集上对其进行了评估。我们发现,来自欧洲的预训练数据集在全球和本地下游评估方面均优于全球和特定大陆的预训练数据集。为了研究影响预训练数据集下游性能的因素,我们利用各大洲、生物群落、土地覆盖和光谱值的多样性分析了 10 个预训练数据集。我们发现只有光谱多样性与性能强相关,而其他则弱相关。这一发现建立了创建高性能预训练数据集时要考虑的多样性的新维度。我们在 https://github.com/kerner-lab/pretrain-where 开源了 7 个新的预训练数据集、预训练模型和实验框架。