论文
用于语言模型预训练的复杂性引导的逐组件初始化
Complexity-Guided Component-wise Initialization for Language Model Pretraining
摘要
预训练的语言模型通常表现出结构化权重谱,这表明训练可能会重复产生类似的分层和组件式组织。我们询问这些重复出现的频谱模式是否可以重新用作 GPT-2 式语言模型预训练的初始化信号。首先,我们分析了 11 个预训练的 GPT-2 式检查点,这些检查点的大小、语言、分词器和训练语料库各不相同,测量跨层和 Transformer 子组件的 Frobenius 范数和有效秩熵。检查点显示了共同的深度趋势,特别是残差写入矩阵中规模的增加和更强的光谱集中。然后,我们构建模仿预训练模型的分量幅度和频谱轮廓的初始化方案,并将它们与几种权重初始化方法进行比较。这些初始化器明显改变了模型的结构谱模式,但评估结果并未显示出相应的性能优势。预训练权重重用仍然具有竞争力,而单独的粗谱匹配并不是可靠的优化策略。我们的结果表明,预训练光谱对于训练模型结构是有用的诊断,但有效的重用可能需要保留比组件规模和奇异值形状更丰富的信息。