论文

Matryoshka语言模型套件:单架构嵌套联合训练多尺寸子模型

Matryoshka Language Model Suites

模型架构Transformer

摘要

传统上训练语言模型套件需要分别训练每个模型并独立部署服务。我们通过将尺寸递增的子模型堆叠进单一嵌套架构并端到端训练,同时提升训练与推理效率。这一Matryoshka训练框架降低了套件的总参数量,能在每个训练步骤以低成本从最大模型蒸馏到所有更小的子模型,并且由于草稿模型包含在验证模型之内,天然适合投机解码。我们通过训练一个包含500M、1.5B和3B子模型的Matryoshka套件来验证该方法。该套件在基准性能以及验证集与域外困惑度上与独立训练的基线相当,同时训练算力减少36%,投机解码吞吐提升14-26%。我们还在消融实验中考察了关键架构选择,为构建强大的Matryoshka LM套件提供指导。

Matryoshka语言模型套件:单架构嵌套联合训练多尺寸子模型:论文配图
(a) 每个token的总KV缓存(b) 平均PPL差距(c) 平均基准准确率差距。图7:200M规模下的形状消融。每个点都是一个共享50M基础子模型的Matryoshka变体;坐标轴为100M和200M模块的附加层数。(a) 每个token的总KV缓存,色标上标注了同架构的Vanilla 200M基线。(b) 相对Vanilla基线的平均困惑度差距,在三个子模型规模(50M / 100M / 200M)上取平均;蓝色表示低于Vanilla。(c) 表2中七个下游基准上的平均准确率差距(以百分点计),在三个子模型规模上取平均;蓝色表示高于Vanilla。