论文

归一化 Transformer 中的学习率迁移

Learning Rate Transfer in Normalized Transformers

模型训练预训练

摘要

标准化 Transformer 或 nGPT (arXiv:2410.01131) 实现了令人印象深刻的训练加速,并且不需要权重衰减或学习率预热。然而,尽管具有显式随模型大小缩放的超参数,但我们观察到 nGPT 并未表现出跨模型维度和词元范围的学习率迁移。为了纠正这个问题,我们将数值实验与原则上使用对齐指数 (arXiv:2407.05872) 结合起来,重新审视和修改 $μ$P 超参数传递方法 (arXiv:2011.14522)。结果是一种新颖的 nGPT 参数化,我们称之为 $ν$GPT。通过广泛的实证验证,我们发现 $ν$GPT 表现出跨宽度、深度和词元范围的学习率转移。