论文
TESSERA v2:逐像素地球模型的规模化训练地球基础模型
TESSERA v2: Scaling Pixel-wise Earth Foundation Models
摘要
逐像素地球观测 (EO) 基础模型现在通过生成的空间嵌入实现了最先进的性能。然而,人们对这些模型如何扩展以及如何最好地使用预训练预算仍然知之甚少。我们提出了迄今为止最大的 EO 受控扩展研究:在固定像素级 Barlow Twins 系列中进行了 395 次训练,每次训练都针对 15 个不同的下游任务进行了评估。我们发现预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),因此通过损失选择模型会浪费很大一部分计算量。我们还发现,随着训练预算的增长,编码器和数据应该一起增长,而投影仪保持固定,这给出了分配计算的简单规则。使用此规则,我们训练一系列像素级教师(0.5B、1B 和 2B),并将最大的学生提炼为紧凑的学生,以进行嵌入数据部署。总的来说,我们的 4400 万参数蒸馏学生优于我们测试的每个开放和专有嵌入产品,其中几个产品的性能要高出一个数量级。这些学生生成的俄罗斯套娃表示形式的服务成本低廉:16 维前缀将 92% 的完整 128 维性能保持在 1/8 的存储空间中。总之,这些结果给出了一个具体的、基于经验的方法,用于缩放像素级 EO 基础模型:训练大型编码器,根据下游性能进行选择,并提炼成灵活的学生模型。我们计划在 2017-2025 年期间发布全球每年 1000 万个嵌入,作为 TESSERA 基础模型嵌入产品的第二版。所有代码均位于:https://github.com/ucam-eo/tessera