论文
PowerOPD:通过有界功率变换稳定 同策略 蒸馏
PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation
摘要
大语言模型 的标准 同策略 蒸馏 (OPD) 使用学生采样的标记来估计反向 KL 目标,从而产生避免词汇范围计算的无偏单样本蒙特卡洛估计器。然而,我们表明该估计器在实践中遇到了严重的训练问题:样本效率低下、生成动态不稳定以及与精确的全词汇 OPD 相比存在巨大的性能差距。奖励级别的诊断将这些病理学追溯到对数比率奖励,该奖励不受构造的限制,产生集中在早期位置并在整个训练过程中持续存在的极高方差梯度;标准事后缩放会失败,因为它们仅在发生这种扭曲后才起作用。为了解决这个问题,我们提出了 PowerOPD:来自 Box-Cox 幂变换的一系列原生有界、符号一致的奖励,参数化为 alpha > 0,其中对数比是退化的 alpha -> 0 极限。在六个数学推理基准测试和四个 Qwen3 师生对中,PowerOPD 的基准平均 Avg@8/Pass@8 增益比普通 OPD 高达 +6.37/+5.71,比事后稳定性提高 +3.01/+3.54,比全词汇 OPD 提高 +2.59/+8.90,同时将挂钟时间减少 59.2%,峰值 GPU 内存减少23.1%。较大的 alpha 通常会提高准确性,持续缩短响应,并使梯度范数比普通 OPD 小 3,000 倍以上。