论文

EarthShift:衡量地球观测中真实世界分布变化稳健性的基准

EarthShift: a benchmark for measuring robustness to real-world distribution shifts in Earth observation

模型评测基准与评测资源

摘要

当前的地球观测基准侧重于测量不同任务和应用程序的性能,通常测量分布中的泛化。但是,当部署模型时,它们必须泛化到无数的分布外场景,例如新的时间段、地理位置、规模和传感器。我们推出 EarthShift:第一个公共测试平台,用于对遥感中遇到的多个实际分布变化进行基准稳健性测试。 EarthShift 使用户能够使用来自不同来源、时间窗口、地理位置和传感器的配对数据集的数据集来比较分布内和分布外的性能,从而测量分布稳健性。我们对 8 个地理空间基础模型 (GFM) 和涵盖 5 种班次类型的 11 个任务进行的实验表明,无论模型架构、大小、预训练 或 微调 策略如何,GFM 在分布外的平均表现始终较差 15-20%。我们证明 GFM 的鲁棒性与通用视觉基础模型甚至完全监督模型的鲁棒性相似。这凸显了未来研究需要努力提高分布稳健性,而不仅仅是性能,可以使用 EarthShift 进行基准测试。我们发布代码和数据集,以提供一个测试平台来指导未来的工作,以创建在实际应用中稳健可靠的基础模型。 EarthShift 的代码和数据可在以下位置获取:https://earthshift.github.io