训练您部署的内容:缩小低秩克隆中的 MLP 可达性差距 蒸馏
Train What You Deploy: Closing the MLP Reachability Gap in Low-Rank Clone Distillation
摘要
压缩学生有两种不需要一致的形状:它在推理时部署的权重和它的训练可以达到的权重系列。我们展示了最先进的权重继承蒸馏器 Low-Rank Clone (LRC),部署了全宽学生 MLP,但将训练与教师诱导的切片联系起来,使得每个部署矩阵的独立线性自由度的 62.5-81.4% 在推理时无法达到,永远无法训练。我们的原则是:训练你部署的东西。从相同的 LRC 热启动开始,我们通过两个可合并的实现(Dense-LRC 和 CORE-LRC)将训练对象设为整个部署的矩阵,部署的形状、部署的参数计数或推理 FLOP 没有变化,这两个实现都折叠为一个部署的权重。这恢复了搁浅的能力:在三个教师(Llama3.2-3B、Llama3.1-8B、Qwen2.5-3B)的匹配预算普通LRC基线上,每位教师的实现能力更强,+2.36/+2.71/+10.45 Avg9,其中最广泛的教师(Qwen)的增益最大,达到了原始配方的大约10%。 10B 词元的准确性为 20B 词元(2 倍词元效率);严格同系手臂仍然恢复+6.39,完全控制的数字。控件强烈支持将增益归因于扩大的可达集,而不是添加的参数或配方。从大约。 10B 蒸馏 词元加上一个短 SFT,半参数 1.5B 学生与其大约匹配。 9T 词元教师的 9 任务宏平均,在评估噪声内且具有残余 MMLU 赤字,并且 2.7B 学生以约 900 倍的压缩词元数量击败了 Meta 自己的 Llama3.1-8B 官方压缩(在不匹配的配方下的词元计数,而不是计算声明)。所有结果均来自 LRC 主干上的单种子运行。