论文
I-SDPO:实例级自适应自蒸馏策略优化
I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization
摘要
组相对策略优化 (GRPO) 从轨迹组内的奖励差异中学习,但当每个采样响应不正确时,不会收到有用的相对信号。特权自我 蒸馏 可以通过密集的词元监督来填补这一空白,但在整个训练过程中应用它会产生不同的失败模式:教师是奖励目标的有偏见的、低方差的替代者,因此在策略能够产生成功的轨迹后,持续的模仿可能会反对奖励改进的更新。我们引入了 I-SDPO(实例级自适应自我 蒸馏 策略优化),它将教师依赖视为能力依赖。 I-SDPO 为每个输入实例制定一个路由决策,并在该实例的转出组中共享该决策:所有错误组使用特权自 蒸馏 目标,而任何成功组对于 GRPO 保持不变。这种设计仅在群体相关奖励无法提供信息的情况下使用模仿。本地分析描述了教师和奖励方向何时一致的特征,并表明非消失偏置 蒸馏 权重会导致优化偏差下限。随着成功概率的增加,路由规则会自动降低预期的 蒸馏 率,从而在无需手动设计时间表的情况下撤回教师的影响。在 SciKnowEval 上,I-SDPO 在所有四个科学领域都获得了最佳结果,并将平均mean@16 准确率从 GRPO 的 56.67% 提高到 70.31%,最大领域增益为 18.24 分。