论文

小初始化对大语言模型至关重要

Small Initialization Matters for Large Language Models

模型训练预训练

摘要

大语言模型为追问智能本身如何涌现——而非仅LLM如何被工程化——提供了可行系统。虽然进展常归因于规模、数据与架构——我们表明参数初始化是训练(尤其是模型容量)的类基因决定因素。降低初始化规模持续改进预训练——在需要推理的任务上增益最大。我们识别两个广泛使用、抑制小初始化优势的经验设定——并展示放松它们如何恢复有利扩展。我们进一步发现平衡推理与训练的临界初始化。机制上——小初始化驱动独特的发展轨迹:参数先凝结为低复杂度结构——再扩展为更丰富表示——为“压缩即智能”提供了具体形态。token级分析显示增益集中于非平凡、上下文受限的预测——而非均匀作用于全部token。这些结果激发简单的γ初始化规则:把初始化幅度暴露为显式旋钮——默认使用小初始化——一项近乎零成本的干预——跨模型规模改进预训练并强化推理。

小初始化对大语言模型至关重要:论文配图
图 1:(a) 两个初始化尺度 γ=0.5\gamma=0.5 和 γ=1\gamma=1 下不同模型大小的验证损失。 (b) 模型尺度上 γ=0.5\gamma=0.5 和 γ=1\gamma=1 之间的绝对验证损失减少。 (c) 在两个不同的 ϵ\epsilon 设置下,有效 RMSNorm 缩放因子作为 γ\gamma 的函数,其中 d=2048d=2048。 (d) 在 γ=1\gamma=1 下使用不同 ϵ\epsilon 值训练的 1.5B 模型的训练损失曲线。 (e) 在初始化尺度 γ\gamma 和 RMSNorm ϵ\epsilon 的不同组合下的最终验证损失比较。 (f) 1.5B 模型中不同初始化尺度下的逐层注意力接收器得分。 (g) 在 γ=1\gamma=1 下有和没有门控注意力的逐层注意力池得分。 (h) 在不同初始化尺度下使用和不使用门控注意力训练的模型的最终验证损失比较。