论文

CADENCE:通过覆盖自适应缩小推理差距 同策略 蒸馏

CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation

摘要

同策略 知识蒸馏 将推理从大型教师转移到紧凑的学生,但现有方法遭受三种复合失败模式:(i)冷启动崩溃,其中新学生将接近零的质量分配给教师首选的词元; (ii) 状态不可知的发散调度,其中仅时间的前向/反向 KL 插值忽略学生的覆盖状态; (iii) 二元奖励稀疏性,其中通过/失败信号丢弃来自部分正确轨迹的信息。我们推出了 CADENCE,这是一个统一的框架,并针对每个框架进行了针对性的修复。它的 DRIFT 机制在学生采样轨迹上安排前向 KL 和反向 KL 代理目标的每个词元凸混合(每个词元代理,而不是序列级 KL 梯度估计器)。六个组成部分对其进行了扩展:(A) COVA,一种覆盖范围自适应的 $β$ 计划,加速了正向到反向的过渡; (B) FTB,通过全局标准化熵参考在高熵位置集中梯度的分叉词元提升; (C) CCD,一种密集奖励,为不正确但接近的痕迹添加数字邻近部分信用; (D) LAP,简洁优先正确展开强化; (E) EMR,熵匹配校准正则器; (F) BSD,自举 蒸馏 阶段。在 GSM8K 和 MATH-500(修正的 512 词元协议,5 个种子,报告标准)上,CADENCE 将 0.5B 学生从 1.5B 教师提炼到 69.8 $\pm$ 0.5% GSM8K pass@1(从 48.7% 预训练;63.2% 的教师差距缩小)到 72.1 $\pm$ 0.4% 3B 教师(76.2% 关闭),击败了最强的匹配计算标签使用基线(DRIFT+二元奖励)+4.4 $\pm$ 0.7 点。所有实验都在单个 Apple Mac Studio(M 系列,64GB 统一内存)上运行,表明有原则的 蒸馏 无需数据中心规模的硬件即可达到强大的推理质量。