论文
SR-OPD:把教师token花在关键处的在线蒸馏
Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation
摘要
在线蒸馏(OPD)把学生自生成的rollout与教师的稠密token级监督结合,但为每个rollout提供这种监督需要大量教师计算。我们提出成功参照在线蒸馏(SR-OPD),通过选择哪些提示与rollout接受教师监督来降低成本:当学生对同一提示产出成功与失败的rollout时,成功rollout可作为挑选失败rollout的自然参照。SR-OPD因此聚焦这类提示,优先选择隐状态轨迹与成功参照持续发散的失败rollout,同时计入估计的教师输入成本。在三个教师-学生对与六个数学推理基准上,单遍设置下SR-OPD只使用原版OPD所需教师输入token的3.46-5.02%而保持相当推理性能。在匹配原版OPD教师预算5%的受控设置下,进一步实验支持两个关键设计:把监督聚焦于同时产出成败rollout的提示,以及用成功rollout指导失败选择。结果表明学生自身的成功行为可作为固定教师预算下分配教师监督的有用参照。