论文
Seg-OPD:分段在线蒸馏学习推理修订
Learning to Revise Reasoning with Segment-wise On-Policy Distillation
摘要
在线蒸馏(OPD)以教师的稠密token级监督在学生自身rollout上训练其推理。但token级OPD没有显式提供一个连贯的替代推理步骤来说明学生的步骤如何修订才能改善后续推理;且当学生产生退化的推理前缀时该范式效力下降——后续教师监督仍以该前缀为条件,可能强化糟糕的推理模式。本文聚焦以分段OPD学习推理修订,重做中间推理步骤以更好支撑后续推理。通过受控推理干预,我们发现用教师重写替换学生分段能改善后续推理准确率。为此我们把教师重写变成学习推理修订的显式监督:提出分段在线蒸馏(Seg-OPD),按不确定性度量选择学生分段并获取相应教师重写,训练学生偏好教师重写而非配对的学生分段,同时保留稠密token级OPD监督。数学推理与竞赛编程任务的大量实验显示,Seg-OPD训练的学生比基线取得更高的修订成功率;Seg-OPD在推理准确率上持续优于对比SOTA基线,跨模型与任务平均相对改进5.22%。代码/项目页:https://anonymous.4open.science/r/Seg-OPD。