论文

稀疏探针和模糊物理:连续介质动力学基础模型中可解释性挑战的案例研究

Sparse probes and murky physics: a case study of interpretability challenges in a foundation model for continuum dynamics

模型评测模型行为与机制分析

摘要

生成式人工智能模拟器越来越多地用于科学领域,在这些领域我们已经拥有强大的理论、基准和物理直觉。这就提出了一个中心评估和可解释性问题:当基础型模型可以重现已知的连续动态时,什么内部机制支持该行为,内部行为是否与已知的物理一致,以及它与模拟器的成功或失败有何关系?我们利用物理原理指导的机械解释性,研究了连续介质动力学的跨域基础模型,即 Polymathic 的 Walrus。我们应用稀疏自动编码器 (SAE) 来探测选定的层,并解决使用熵作为物理基础指标对大型特征集(超过 20,000 个)进行分类的实际挑战。作为一个故意简单的测试平台,我们专注于剪切流并比较多个剪切流设置的特征招募,即数值模拟中的参数值。在各个设置中,我们发现了分段一致性的证据,特征子集在类似的角色中重复出现,但这种结构是间歇性的,并且不能清楚地映射到标准物理分解上。与此同时,数值模拟和仿真器之间的直接比较揭示了系统的输出水平差异,包括能量/结构变得过于分散或过于局部化的情况。我们将这些差异的部分内容与特定 SAE 功能使用的变化联系起来。我们的工作强调了科学基础模型的开放性问题:如何稳健地优先考虑机械上有意义的特征,如何将稳定结构与分析工件(包括单层和 SAE 限制)分开,以及如何使用既定的基准来决定“不同”的内部表示何时真正具有信息性而不仅仅是有效。