论文
MESH:用于专家混合训练的内存高效 Sinkhorn 优化
MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training
摘要
内存高效的矩阵优化器(例如 Sinkhorn 梯度下降)删除了密集 Transformer 矩阵的大多数 AdamW 优化器状态,但直接应用于专家混合 (MoE) 训练是不可靠的。我们在受控的 110M 参数纳米鲸 DeepSeek 式 MoE 预训练环境中研究了这种失败。 SAGE/Sinkhorn 混合将优化器状态从 0.883GB 减少到 0.331GB,但将评估损失降低到 3.8265,远高于在相同设置中观察到的 AdamW 基线(我们研究的种子为 3.58--3.64)。我们表明,路由的 MoE 专家矩阵是主要的失败点:它们的梯度是有条件的、随时间变化的,并且无状态 Sinkhorn 归一化效果不佳。我们为教育部专家提出了 MESH,这是一项隐藏动量 Sinkhorn 更新。 MESH 通过梯度缓冲区生命周期恢复时间一阶矩信号,而不将专家一阶矩存储为优化器状态。 MESH 是一种可选的块预处理变体,它添加了粗神经元/块逆 RMS 乘数。在消融过程中,矩阵归一化之前的时间平滑是主要的因果因素。块/神经元预处理可以改善记忆质量边界,但并未被认为是普遍必要的。在另外两个种子中,相对于 AdamW,MESH 和 MESH-B 将优化器状态内存减少了 62.5%,峰值 PyTorch CUDA 分配减少了约 12.6%,评估损失差距不大。全状态诊断变体在消融中恢复了类似 AdamW 的性能,支持了 MoE 专家需要时间平滑的结论,但不一定是完全坐标明智的 AdamW 状态。