论文
SR-OPSD:自引用 同策略 自 蒸馏
SR-OPSD: Self-Referenced On-Policy Self-Distillation
摘要
同策略 self-蒸馏 (OPSD) 将反馈转换为对学生生成轨迹的密集 词元级 监督,以稀疏结果奖励补充强化学习。它的自学教师源自学生当前或指数平均参数,并以附加上下文为条件,随着学生及其执行轨迹上下文分布而发展。修改这个移动目标的好处取决于目标-学生概率不匹配如何转化为更新。我们提出 \emph{Self-Referenced 同策略 Self-蒸馏 (SR-OPSD)},它从自教师和冻结的初始策略构建归一化几何目标,然后最小化从该目标到学生的前向 Rényi 发散。插值系数控制自教师的贡献,而Rényi阶控制梯度中目标与学生概率比的功率权重。对于固定上下文和目标组件,我们建立了条件变分表征并导出了精确的 token-logits 梯度,揭示了锚定和投影如何共同塑造有效的更新目标。科学推理、工具使用、数学推理和代码生成方面的实验证明了跨多个模型系列和规模的强大性能。消融进一步表明,参考锚定可以根据投影目标提高或降低性能,支持目标构造和投影几何的联合设计。