论文

超越准确性:评估地理空间基础模型的校准及其对分布变化的敏感性

Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts

模型评测鲁棒性、公平性与可信度评测

摘要

地理空间基础模型 (GeoFM) 最常见的是通过平均排名根据标准基准条件的准确性进行排名和选择。我们表明该协议过于狭隘:在关键 EO 任务中承诺的部署需要进一步的分析角度,主要是校准、模型置信度与其正确性之间的一致性。在 16 个冻结编码器、四个分类和五个分割数据集以及两个正交应力轴中,每个编码器都会随着腐败加剧而降级,并且排名也会发生变化。在四个分类基准中,EO 预训练和 ImageNet 预训练编码器在干净精度和干净校准方面没有区别,并且 EO 预训练在移位情况下不提供比 ImageNet 预训练更高的稳定性。在转变下,GeoFM 在每个等级和每个腐败家族中都比 ImageNet 预训练的编码器进一步陷入过度自信。中心核对齐 (CKA) 分析将其与表征刚性联系起来:EO 预训练嵌入在损坏情况下移动较少,同时丢失同样多的任务信息并保持过度自信。我们应用了三种常用的不确定性量化方法,发现温度缩放和深度系综无法抵消退化,而高斯过程探测器仅通过在干净数据上将 ECE 增加两倍来将严重云下的 ECE 大致减半。在选择性预测实验中,我们发现基于置信度的弃权不能回避确信错误的预测,因此主张基准排名和评估应在多种条件和指标下进行操作,以更全面地评估模型开发进度并缩小与现实世界部署场景的差距。