论文

同策略 蒸馏 中逃离 KL 协议陷阱

Escaping the KL Agreement Trap in On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 通过要求教师对学生生成的卷展进行评分来提供密集的 词元级 监督。然而,当学生陷入不可恢复的前缀时,教师可能局部同意降级状态,产生低反向 KL,但几乎没有纠正训练信号。我们将这种持续存在的制度视为低 KL 协议陷阱。进一步的分析表明,此类陷阱期间和之后的词元产生的监督信号不太有用。我们提出 KAT(KL 协议陷阱终止),这是一种在线 OPD 终止规则,可通过动态训练自适应阈值检测持续的低 KL 协议。通过过滤退化协议中的弱监督,KAT 在四个数学基准中将 avg@k 准确率提高了 2.66%,将 pass@k 准确率提高了 3.43%,同时将平均生成轨迹长度缩短了 59.73%。