论文

尺寸可忽略不计,效果显着:大语言模型 中的尺度向量

Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models

模型架构Transformer

摘要

现代 大语言模型 (LLM) 中的归一化层由确定性归一化操作和可学习的尺度向量组成。虽然归一化运算已被广泛研究,但尺度向量尽管用途广泛,但仍对其了解甚少。在这项工作中,我们从表达性、优化和架构结构的角度对 LLM 中的尺度向量进行了系统的研究。首先,我们凭经验证明,虽然尺度向量仅构成模型参数的一小部分,但删除它们会大大降低 LLM 预训练 的性能。我们的理论进一步表明,在 Pre-Norm 架构中,尺度向量不会增加表现力;相反,它们通过对后续线性映射的自放大预处理效果来改进优化。其次,我们研究尺度向量的权重衰减的作用。通过区分输入范数层和输出范数层,我们从理论上表明,权重衰减对前者有利,但对后者有害,因为它们在优化和表现力方面发挥着不同的作用。第三,受这种理解的启发,我们提出了对尺度向量的三种轻量级和互补的改进:特定分支的异质性、线性映射周围的改进放置以及幅度方向重新参数化。理论和实验都表明,每次改进都会产生一致的收益。最后,我们将这些改进结合到统一的尺度向量策略中,并通过在工业规模 词元预算 下对密集模型和混合专家模型(参数范围从 0.12B 到 2B 参数)、跨多个优化器和学习率计划的广泛 LLM 预训练 实验对其进行评估。统一策略始终比经过良好调整的基线实现更低的终端损耗,并表现出更有利的扩展行为,同时增加的参数和计算开销可以忽略不计。