论文

基于链的 蒸馏 用于有效初始化可变大小的小语言模型

Chain-based Distillation for Effective Initialization of Variable-Sized Small Language Models

摘要

大语言模型 (LLM) 实现了强大的性能,但在资源受限的环境中部署成本仍然很高。从头开始训练小语言模型(SLM)的计算成本很高,而传统的 知识蒸馏 需要针对不同的目标大小反复访问大型教师,导致可扩展性较差。为了解决这些问题,我们提出了 \textbf{基于链的 蒸馏 (CBD)},这是一种用于有效初始化可变大小语言模型的可扩展范例。通过逐步 蒸馏 构建稀疏且有限的中间模型序列(称为锚),形成 蒸馏 链,逐步从源 LLM 传输知识。为了支持异构设置,我们引入了 \emph{bridge 蒸馏} 来进行跨架构和跨词汇传输。通过相邻锚点之间的参数插值来初始化可变大小的模型,消除重复的大教师推理。实验表明,所提出的方法大大提高了效率和下游性能。没有恢复 预训练 的 138M 参数 SLM 在特定任务上优于 10B 词元语料库上的临时训练模型。 CBD 还展示了异构设置中的多功能性,用于初始化具有不同架构和词汇的模型。