论文
大语言模型 预训练的隐藏层蒸馏的研究
A Study on Hidden Layer Distillation for Large Language Model Pre-Training
摘要
知识蒸馏 (KD) 是训练 大语言模型 (LLM) 的关键工具,但大多数研究集中于仅依赖于输出 logits 的方法,忽略了教师中间表示中的语义信息。虽然隐藏层 蒸馏 (HLD) 显示了编码器架构的潜力,但其在仅解码器 预训练 上的大规模应用仍未得到探索。通过计算控制实验,我们将 HLD 与基于 logits 的 KD 和自监督基线进行基准测试,以 Gemma3 3.4B 作为教师,并使用来自 C4 数据集的多达 168B 词元对 1.23 亿和 7.35 亿学生进行训练。我们的实验表明,HLD 在下游评估任务上并不总是优于标准 KD。尽管如此,我们表明,在所有共享超参数配置中,HLD 可以比 KD 产生系统的困惑度增益,这表明可以提取潜在信号,但可能需要突破才能使其在 LLM 预训练 中发挥更重要的作用。