论文

失配至关重要:超越token一致性的在线策略蒸馏

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

摘要

在线策略蒸馏(OPD)已成为现代大语言模型后训练管线的核心组成部分,但我们揭示了一种失败模式:退化一致性(degenerate agreement),即学生通过重复循环实现对教师近乎完美的token一致性,而整体响应却有缺陷。因此我们将关注点从一致性转向师生失配(mismatch),发现失配token主要可分为两类:学生多余token(student-excess)与学生缺失token(student-deficit)。学生多余token由学生生成但被教师赋予近零概率;其log-ratio校正会无界增长并使更新不稳定。相反,学生缺失token是教师偏好但学生很少采样到的token;其缺失阻碍了教师推理模式的迁移。为应对这些失配方向,我们提出TIDE(Token-level Independent Deficit-Excess correction),它应用有界Hellinger整形来抑制最严重的已采样多余,并用解析式教师top-K注入来恢复缺失的概率质量,而无需缺失token被实际采样。在多个Qwen3师生对的数学推理基准上,TIDE持续优于标准OPD以及近期的token选择和奖励整形基线。此外,在师生失配严重时TIDE的收益更显著:将Avg@8从6.9%提升到20.3%,平均响应长度缩短至原来的1/3.6,并大幅减少格式失败。代码发布于 https://github.com/yzc-666/TIDE。

失配至关重要:超越token一致性的在线策略蒸馏:论文配图
图2:重复造成退化的共识。对一个代表性OPD rollout的可视化,其中学生模型反复生成序列 You are a helpful assistant.\n。左、右热图分别展示学生和教师在逐渐加长的重复前缀条件下的下一token分布;各行对应重复单元中的token,颜色越深表示概率越高。随着重复持续,两个模型都聚焦到相同的周期性延续上:它们的top-1预测达成100%100\%一致,而中位师生KL降至0.00040.0004 nats,如下方条带所示。因此,全局退化的rollout在token级监督下看起来局部对齐良好。