论文

解耦 KL 与轨迹:统一理解语言模型蒸馏中的 SFT、DAgger、离线 RL 和 OPD

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

摘要

知识蒸馏 是 LLM 后训练 的核心,但其设计空间仍然知之甚少,尤其是与强化学习 (RL) 一起使用时。我们证明了流行的范式 离策略 蒸馏 和 同策略 蒸馏 (OPD) 隐式耦合了两个正交选择:前缀源和 词元级 KL 方向。这是从自回归响应分布上分解序列级 KL 得出的结果:正向 KL 将教师前缀与 词元级 正向 KL 配对,反向 KL 将学生前缀与 词元级 反向 KL 配对。我们认为这种耦合不是内在的:将两个轴解耦会产生四个有效的目标。我们建立了梯度级恒等式,表明正向 KL 给出了与教师软目标匹配的 SFT 式交叉熵,而反向 KL 给出了具有密集师生对数比奖励的 RL 式策略梯度目标,将它们连接到 离策略 SFT、DAgger 式 同策略 SFT、离线 RL 式 蒸馏 和 OPD。我们对数学推理进行了广泛的对照研究,评估了四个目标作为独立方法和后续强化学习的初始化。结果揭示了三个权衡:KL 方向导致准确性-熵权衡,前缀源导致质量-计算权衡,训练长度导致准确性-稳定性权衡。受这些发现的启发,我们提出了 KL 混合和熵门控长度课程。 KL 混合显示长序列 蒸馏 需要大量的前向 KL 权重,以防止熵崩溃和长度膨胀,而不牺牲准确性。与固定长视野训练相比,熵门控长度课程将 Avg@k 和 Pass@k 提高了 3.6 分,最高可达 5.8 分,并将平均响应长度缩短了大约 3 倍。我们的结果为设计平衡准确性、多样性、计算和强化学习行为的推理 蒸馏 目标提供了一个框架和实用方法。