论文
教师应该如何准备? 学生模型上策略蒸馏的 RL 诱导状态
How Should Teachers Be Prepared? RL on Student-Induced States for On-Policy Distillation
摘要
在策略蒸馏(OPD)通过对学生模型生成的轨迹进行token级教师模型监督来提高小语言模型的推理能力。但擅长独立解决问题的老师是否也能有效指导学生模型推理呢?先前的研究表明,当学生模型前缀遵循与教师模型不同的推理路径或包含错误时,教师从这些前缀继续进行的推理可能不如独立解决问题时准确。为此,我们提出了 Prep-OPD,它在蒸馏之前使用强化学习(RL)来训练教师模型以适应学生模型现有的推理状态并在出现错误时纠正过程。 训练使用最终答案正确性作为奖励,优化固定学生模型前缀的教师模型延续。准备好的教师模型然后通过轨迹引导和token级别的监督来训练学生模型。我们使用 Qwen3-4B-Instruct-2507 作为教师模型,使用 Qwen3-0.6B 和 Qwen3-1.7B 作为学生,在八个数学推理基准上评估 Prep-OPD。与 4B 教师模型和 1.7B 学生模型相比,Prep-OPD 的平均准确度比标准 OPD 和最强基线 Relay-OPD 分别提高了 8.28 和 2.30 个百分点。对照实验进一步表明,以学生模型生成的前缀为条件的教师模型 RL 比在 Qwen3-1.7B 上有切换和无切换的问题启动教师模型 RL 产生更高的学生模型精度。重复使用相同准备的教师模型也改进了 Qwen3-0.6B。
