论文

GraphCast 大气河流的机制解释

Mechanistic Interpretability of Atmospheric Rivers in GraphCast

模型评测模型行为与机制分析

摘要

虽然人工智能天气模型现在可以与业务预测相媲美,但它们如何在内部表示大气仍然是一个悬而未决的问题:特征归因揭示了哪些输入模式很重要,而不是模型计算的内容或内部如何组合信息。我们在 GraphCast 上训练稀疏自动编码器 (SAE),以揭示其学到的概念,并使用大气河流作为我们关注的现象。标准和俄罗斯套娃 SAE 均显示 GraphCast 计算大气河流强度(通过积分水汽传输 (IVT) 测量)作为稳定的内部变量,尽管 IVT 既不是输入也不是目标。与标准 SAE 的非结构化概念检索相反,Matryoshka SAE 按重要性对概念进行排序并揭示它们的关系。大气河的概念在深度上持续存在,直接干预证实了因果关系。这种方法提供了一种寻找内部变量并确定模型实际依赖于其中哪些变量的方法,这是询问这些变量在气候变暖时现象发生变化时是否仍然有意义的先决条件。

GraphCast 大气河流的机制解释:论文原图
图 5:六个 SAE 的训练重建损失相对于训练的一部分,每个架构一个面板,按深度着色。每个损耗都是在 SAE 自己的操作空间中测量的,因此面板的绝对值不具有可比性。 Matryoshka SAE 每 500 步记录一次,因此其曲线在原始每步值(微弱)上绘制平滑(粗体)以显示趋势。