论文

ReOrder-OPD:同策略 蒸馏 的可靠性感知提示订购

ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 将 词元级 教师监督应用于学生生成的轨迹,但这种监督并不总是可靠。现有方法使用局部置信度或师生一致性来对采样轨迹进行加权、过滤或截断。这些信号并不直接确定教师是否可以继续将学生前缀延续到正确答案,并且轨迹级干预可能会将一次展示的不可靠性与其提示的低预期训练价值混为一谈。我们将提示级教师延续可靠性 $R$ 定义为教师从学生前缀得出正确答案的概率,对当前学生引起的前缀和轨迹进行平均。 Oracle 实验表明,高 $R$ 提示会产生更大的 OPD 增益,并且在固定提示池上,降序 $R$ 训练优于随机和升序训练。由于估计 $R$ 需要许多教师延续,因此我们在一名独立学生执行轨迹和验证者正确的相同提示教师轨迹之间使用最大 ROUGE-5 F1。在这个实际得分的十个等频区间中,平均 $R$ 单调上升,表明代理分离了粗略的可靠性水平。 ReOrder-OPD 通过代理对提示进行排序,然后为普通 OPD 绘制独立的 同策略 训练轨迹。它改进了 Qwen3 和 Gemma4 数学设置以及 Qwen3 代码设置之间的每个匹配聚合比较。所有六种 FiRe-OPD 和 ExOPD 设置的增益表明,即时排序补充了轨迹内监督。