论文

PACED:学生能力前沿的提炼

PACED: Distillation at the Frontier of Student Competence

摘要

标准LLM蒸馏浪费在两个方面进行计算:学生已经掌握的问题(接近零梯度)和远远超出其能力范围的问题(侵蚀现有能力的不连贯梯度)。我们证明这种浪费不仅是直观的,而且在结构上是不可避免的:蒸馏中的梯度信噪比在两个通过率极端情况下都可能消失。这一理论观察导致了 Paced,这是一个框架,通过从蒸馏梯度的边界消失结构导出的有原则的通过率权重 $w(p) = p^\alpha(1 - p)^\beta$,将蒸馏集中在最近发展区域(学生模型能力的前沿)。主要结果: (1) 理论:我们证明 Beta 核 $w(p) = p^\alpha(1-p)^\beta$ 是一个由蒸馏的 SNR 结构产生的前序权重族,并且它具有极小极大鲁棒性——在有界乘法错误指定下,最坏情况下的效率损失仅为 $O(\delta^2)$。 (2)蒸馏:在从较大的教师模型到具有前向KL的较小学生模型的蒸馏中,Paced比基本模型取得了显着的增益,同时将基准遗忘保持在较低水平。 (3)自蒸馏:在具有反向KL的指令调整模型上,增益也超过基线。 (4)两阶段协同作用:前向 KL-然后反向-KL 时间表在我们的设置中产生了最强的结果,在标准推理基准上实现了实质性改进——支持蒸馏过程的模式覆盖然后合并解释。所有配置仅需要学生进行展示即可估算通过率,不需要架构更改,并且与任何 KL 方向兼容。