论文
PAST:利用学生完整轨迹,为同策略自蒸馏提供特权适配
PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation
摘要
同策略自蒸馏 (OPSD) 使用特权教师来监督从其自己的执行轨迹中采样的前缀的推理模型。然而,每次执行轨迹也揭示了学生的反应如何展开以及是否成功,这是标准 OPSD 不会用来形成教师的学生特定的事后见解。我们引入了学生轨迹的特权适应 (PAST),它将每个完整的学生轨迹视为 OPSD 教师的附加特权信息,同时保持学生的 蒸馏 前缀不变。 PAST 保留学生的下一个词元分布在正确的轨迹上,并使用失败的轨迹来使教师适应学生邻近正则化下经过验证的成功。我们描述了这样一个轨迹条件教师可以将什么转移给仅前缀的学生。 Forward-KL 蒸馏 将教师分布投影到给定前缀的条件算术平均值。该预测将轨迹特定的变化与学生可用的平均政策转变分开。为了获得正确的轨迹,未裁剪的人口目标也将冻结的学生作为理想的分布固定点。在三个数学推理基准测试中,PAST 将 Avg@12 宏观平均值比 Vanilla OPSD 提高了 5.6 个百分点。一项 $2\times2$ 阶乘研究显示了完整轨迹访问和教师适应的收益,而轨迹删除和洗牌证实了适应的教师使用了匹配的事后上下文。