论文

重新思考LLM的归一化位置:课程深度增长下的Post-Norm

Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing

模型评测模型行为与机制分析

摘要

Pre-norm是现代Transformer中标准的归一化位置,因为它便于全深度模型的联合优化。我们追问:当深度通过课程方式引入时,这一偏好是否仍然成立。在课程式深度增长中,每个新增块接收由已训练前缀产生的边界表示,使归一化位置与前向条件化相关。因此我们检验归一化位置与训练课程是否存在交互。在以Qwen3-8B为教师、九层学生为对象的受控蒸馏研究中,联合训练下pre-norm与post-norm难以区分,验证CE仅差0.0004;而在课程增长下post-norm比pre-norm好0.0328,高出约一个数量级。按学生活跃层token数匹配的联合后训练对照仍劣于增长后训练,排除了计算量是唯一解释。排序在课程过程中发生交叉:一旦开始追加块,post-norm便占优。单块与冻结对照将排序变化定位于块追加本身,而非浅层块质量或重新训练。边界诊断将post-norm与稳定的残差尺度相联系,将pre-norm与结构token的尺度漂移相联系;在固定批次上,增长前最后一个块也近乎恒等映射。结合按阶段的交叉现象,这些观察与“新块追加后边界尺度条件化”的解释一致。结果促使我们在此蒸馏设定下,将归一化位置与训练课程视为耦合的设计选择。