论文

跨分词器同策略蒸馏:监督可靠性比覆盖更重要

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

摘要

同策略蒸馏(OPD)让学生在自身生成结果上学习教师反馈。分词器不同需要序列与词表两级对齐。本文检验扩大覆盖是否改善学习。在三对异质师生的数学与代码任务中,尽管词表差异大,严格1:1组已覆盖多数学生词元。对蒸馏前学生采样响应,严格位置的共同词表平均保留几乎全部师生概率质量。每位置仅在学生选出的共同词表top-16上计算反向KL,可达到完整共同词表OPD的准确率,超过所测跨分词器基线。不匹配组再增加跨度对数概率MSE虽覆盖全部监督,却降低准确率。仅用严格损失训练的检查点中,跨度梯度与严格梯度方向一致性较弱或为负,且相对幅度增大,可帮助解释准确率下降。因此应从最大化对齐覆盖转向监督可靠性:严格位置的紧凑监督可能优于更广但弱对齐或冲突的信号。