论文

不同的层,不同的流形:Transformer 优化中的模块级权重空间几何

Different Layers, Different Manifolds: Module-Wise Weight-Space Geometry in Transformer Optimization

模型训练预训练

摘要

权重空间几何在神经网络优化中起着核心作用,但流形约束通常均匀地应用于所有权重矩阵。在这项工作中,我们询问不同的 Transformer 模块是否更喜欢不同的流形几何形状。我们研究用于 GPT-2 预训练的流形 Muon,并比较 Stiefel 和 DGram 约束在注意力和 MLP 块上的分层分配。我们的结果显示出明显的不对称性:用 Stiefel 几何约束注意力层,同时将 DGram 几何分配给 MLP 层,在测试的配置中提供了最佳性能,而反向分配和全 DGram 配置在共享超参数设置下变得不稳定。我们将这种失败归因于 DGram 约束的注意力权重中的奇异值增长,它可以放大注意力 logits 并引起 softmax 饱和。这些发现表明,Transformer 的对称感知和几何感知优化应该是特定于模块的,而不是统一的。