论文
蒸馏前验证:同策略 蒸馏 的提示级教师门控
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 通过由冻结的教师对学生自己的部署提供密集的 词元级 监督来加速 后训练。 Vanilla OPD 在各个提示中统一应用这种监督,而不检查老师对于每个提示是否可靠。因为反向 KL 是模式搜索,所以一个自信错误的老师可能会引发强烈但误导性的更新。分布代理,例如熵或师生似然一致性,衡量不确定性或一致性,但不直接验证结果的正确性。我们引入了教师门控 同策略 蒸馏 (TGOPD),其建立的原则是在接受密集监督之前应立即验证教师的可靠性。 TGOPD 通过一小组经过验证者评分的教师探针来估计可靠性,并在可靠性检查通过时将每个提示专门路由到密集 OPD,否则路由到基于验证者的 GRPO。在 4B 和 35B 学生的数学、代码和指令遵循方面,TGOPD 在所有六个单域设置中都优于 Vanilla OPD,并且在多域训练下在两个尺度上都实现了更高的七基准平均值。通过使用空闲的教师容量进行可靠性估计,TGOPD 还减少了异步 OPD 中教师端的计算浪费,在测量的 4B 单域运行中将教师节点 GPU 利用率从 9.8% 提高到 78.9%。