论文

学得少就是多:过早的上层注意力专业化会损害语言模型预训练

Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining

模型训练预训练

摘要

因果解码器块是分层的:较低层构建较高层参与的残差基础。我们确定了 GPT 预训练中的一个失败模式:在下层特征稳定之前,上层致力于敏锐的注意力模式。我们称之为过早的上层注意力专门化。在早期训练期间仅暂时减慢上层 Q/K 投影,可以在不改变其他参数的情况下提高最终的困惑度和下游精度;它可以防止上层注意力崩溃到不成熟的残余基础上。在 LLaMA 风格的区块中,几乎不需要同样的干预。通过消融,我们将乘法门控 FFN(不是 RMSNorm 或偏差消除)隔离为抑制导致故障的上游残余写入的组件。路径分析统一了这两个发现:学习率干预减少了步长因子,而门控 FFN 减少了同一增长路径上的剩余能量因子。我们的结果将上层 Q/K 时序确定为解码器架构和优化之间的具体交互点。