论文
REOPD:同策略 蒸馏 的可靠性自适应奖励外推
REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 在老师的密集 词元级 监督下按照自己的轨迹训练学生。 ExOPD 等奖励外推方法放大了教师参考对数似然比,超越了直接模仿,但对每个标记应用了单个全局系数 $λ$。这可能会促使学生在隐性奖励中达到极端峰值,从而导致 奖励作弊 和不稳定的训练,并且最佳 $λ$ 因领域而异,需要昂贵的扫描。我们提出 REOPD,一种针对 OPD 的可靠性自适应奖励外推框架。 REOPD 将 词元级 兼容性权重与批次级自适应预算相结合,产生词元式系数 $λ_{b,t}=1+γ_b q_t$,该系数保留教师对齐,同时选择性地沿着可靠的教师参考方向进行推断。它不需要验证者、奖励模型、价值模型或超出标准 OPD 的额外轨迹采样。 REOPD 在单教师数学和多教师环境中的两个领域上都优于 G-OPD,同时在单教师代码上匹配 G-OPD,展示了跨领域和教师配置的有效细粒度可靠性适应。