论文
OGLS-SD:同策略 自我 蒸馏,具有用于 LLM 推理的结果引导 logits 指导
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
摘要
我们研究 同策略 self-蒸馏 (OPSD),其中语言模型通过沿其自己的 同策略 轨迹提取特权教师分布来提高其推理能力。尽管 OPSD 有其前景,但由于教师和学生反应之间的模式不匹配,OPSD 可能会遭受训练不稳定的影响。自我反思的教师反应可能会引入反思引起的偏差和反应模板,从而错误校准 词元级 监督,最终损害学生的推理能力。为了缓解这个问题,我们提出了 OGLS-SD,一种以结果为导向的 logits 指导框架,利用可验证的结果奖励来校准特权教师 logits。具体来说,OGLS-SD 对比了由成功和失败的 同策略 轨迹诱导的教师 logits,为 词元级 指导构建了结果区分的转向方向。数学推理基准测试表明,OGLS-SD 稳定了 self-蒸馏,并比标准 OPSD 和其他变体提高了性能。