论文
通过稀疏专家混合路由消除多物理基础模型中的负传递
Eradicating Negative Transfer in Multi-Physics Foundation Models via Sparse Mixture-of-Experts Routing
摘要
将科学机器学习 (SciML) 扩展到通用基础模型受到负迁移的瓶颈:不同偏微分方程 (PDE) 体系的同时协同训练可能会导致密集神经算子中的梯度冲突、不稳定优化和可塑性损失。特别是,宽带明渠流体动力学和边界主导的多孔介质流对单个密集参数路径提出了不兼容的光谱和几何要求。我们引入了 Shodh-MoE,一种用于多物理传输的稀疏激活潜在 Transformer 架构。 Shodh-MoE 对物理信息自动编码器产生的压缩 16^3 物理潜伏进行操作,该自动编码器具有分词器内亥姆霍兹式速度参数化,将解码状态限制为无散速度流形。该模型保证了精确的质量守恒,在 128^3 网格上实现了约 2.8 x 10^-10(在 FP64 中事后评估)的物理可验证速度散度。 Top-1 软语义路由器动态地将本地化潜在补丁分配给专家子网,为不同的物理机制启用专门的参数路径,同时保留共享专家以实现通用对称性。在混合三维物理张量上运行的 20,000 步分布式预训练中,路由遥测显示了自治域分叉:来自开放通道域的保留验证词元专门路由到专家 0,而多孔介质词元专门路由到专家 1。该模型在两种机制中同时收敛,实现了 2.46 x 10^-5 和 9.76 x 10^-6 的潜在验证 MSE,并解码了物理MSE 为 2.48 x 10^-6 和 1.76 x 10^-6。这些结果支持稀疏专家路由作为减轻通用神经算子中多物理场干扰的实用架构机制。