论文

大策略分歧下 同策略 推理 蒸馏 的教师引导策略优化

Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence

摘要

同策略 蒸馏 (OPD) 已成为 大语言模型 (LLM) 的面向推理的 后训练 的有前途的范例,特别是与可验证奖励的强化学习 (RLVR) 相结合时。现有的 OPD 方法依赖于基于反向 KL (RKL) 的教师对从学生策略中采样的轨迹的监督。然而,我们发现了一个关键的局限性:在师生政策差异较大的情况下,强化学习驱动的探索通常会产生教师分布之外的轨迹,从而导致无信息的负反馈。为了解决这个问题,我们提出了教师引导的策略优化(TGPO),这是一种 同策略 推理 蒸馏 方法,在大策略分歧设置下仍然有效。 TGPO 不是仅仅依靠评价性监督,而是使用教师直接指导学生生成的上下文中的 词元级 生成调节;与 RLVR 式的轨迹级别奖励一起,TGPO 引导探索走向改进的延续。推理基准实验表明,TGPO 始终优于现有的基于 RKL 的 OPD 方法,并且在不同的教师模型中保持稳健。