论文
小初始化对大语言模型至关重要
Small Initialization Matters for Large Language Models
摘要
大语言模型为追问智能本身如何涌现——而非仅LLM如何被工程化——提供了可行系统。虽然进展常归因于规模、数据与架构——我们表明参数初始化是训练(尤其是模型容量)的类基因决定因素。降低初始化规模持续改进预训练——在需要推理的任务上增益最大。我们识别两个广泛使用、抑制小初始化优势的经验设定——并展示放松它们如何恢复有利扩展。我们进一步发现平衡推理与训练的临界初始化。机制上——小初始化驱动独特的发展轨迹:参数先凝结为低复杂度结构——再扩展为更丰富表示——为“压缩即智能”提供了具体形态。token级分析显示增益集中于非平凡、上下文受限的预测——而非均匀作用于全部token。这些结果激发简单的γ初始化规则:把初始化幅度暴露为显式旋钮——默认使用小初始化——一项近乎零成本的干预——跨模型规模改进预训练并强化推理。
