论文
DIAL-OPD:在策略蒸馏中从更少的token中学到更多
DIAL-OPD: Learning More from Fewer Tokens in On-Policy Distillation
摘要
在策略蒸馏 (OPD) 使用token级教师信号来监督学生生成的轨迹。它的采样token变体避免了全词汇概率的成本。然而我们发现,更少的 token 训练可以优于全 token OPD,挑战了更多监督可以改善学习的直觉。这激励通过学习价值来选择token。现有的基于分歧的标准忽略了概率尺度:两个模型分配的概率可以忽略不计的token,称为低-低token,可以收到大的对数比奖励并阻碍学习。我们提出了 DIAL-OPD,一种token选择方法,通过用教师和学生概率的对数平均值加权奖励大小来连接对数概率和概率空间。参数 beta 控制此权重,并保留得分最高的标记。在 4 个师生对和 7 个数学推理基准中,我们将 DIAL-OPD 与 9 个基准进行了比较。仅保留 40% 的token,其性能优于 Vanilla OPD 及其全token变体,平均准确率提升达到 5.25% 超过 Vanilla OPD 点,并且 AIME25 Pass@16 从 13.33% 翻倍至 26.67%。在匹配的保留率下,与最强的token选择基线相比,它的平均准确度相对提高了 18%。有了 4B 教师,DIAL-OPD 在两个学生规模上都超过了使用 8B 教师的最强全token基线,这表明有效的监督分配可以超过教师扩展。进一步的分析表明,适度的贝塔平衡会抑制低低token,从而避免保留有用的分歧。token级别的证据表明,DIAL-OPD 会过滤推理价值有限的高奖励token,同时保留对推理正确性至关重要的监督。