论文
ReNIO:重新衡量 LLM 同策略 蒸馏 的负轨迹重要性
ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 通过根据学生自己生成的输出训练学生模型来改进 LLM 推理,但标准 OPD 平等对待所有学生生成的输出 (SGO),无论其信息量如何。我们在受控过滤实验中观察到一致的不对称性:在 OPD 和 同策略 自 蒸馏 (OPSD) 中,仅在不正确的 SGO 上进行训练优于仅在正确的 SGO 上进行训练。我们的进一步分析表明,在仅正确的 SGO 上训练的模型往往会生成较短的推理轨迹并表现出较弱的反射行为,而不正确的 SGO 可以更好地保留模型能力边界附近的探索性推理。为了利用这个信号而不需要包含完整答案的采样轨迹,我们引入了 ReNIO,它重新加权了 LLM 同策略 蒸馏 的负轨迹重要性。通过使用学生与教师的概率比,ReNIO 识别导致错误推理轨迹的关键标记,并将其信息聚合成标准化样本权重,本质上为可能的负面轨迹分配更大的权重,而不观察最终答案的正确性。由于 Re-NIO 仅使用前缀条件标记概率,因此它保留了 OPD 相对于全面强化学习的前缀训练优势。在数学推理和代码生成任务中,ReNIO 均改善了 OPD 和 OPSD,在数学推理基准测试中,Qwen3-1.7B 的代表性相对增益高达 8.90%,R1-Distill-Qwen-7B 的相对增益高达 10.00%。代码仓库:https://github.com/BDML-lab/ReNIO。