论文

SimCT:恢复交叉标记器 同策略 蒸馏 失去的监督

SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 是一种将教师行为转移到较小学生的标准工具,但它隐含地假设教师和学生的预测是逐个标记进行比较的,只要两个模型对同一文本进行不同的标记,这种假设就会失败。在异构标记器下,精确的共享标记匹配会在词汇表不一致的位置默默地丢弃大部分教师信号。我们提出 \textbf{\underline{Sim}ple \underline{C}ross-\underline{T}okenizer OPD (SimCT)},它通过扩大监督空间来恢复该信号:与共享词元一起,SimCT 在两个词元生成器都可以实现的短多词元延续上比较教师和学生,保持 OPD 损失形式本身不变。我们证明这些单元是最好的联合标记监督接口,并且更粗糙的替代方案消除了对 同策略 学习有用的师生区别。在关于数学推理和代码生成基准的三个异构师生对中,SimCT 显示出相对于共享词汇 OPD 和代表性交叉标记器基线的一致增益,并通过消融确认了改进来自恢复由精确共享标记匹配丢弃的监督。代码可在 \href{https://github.com/sunjie279/SimCT-}{https://github.com/sunjie279/SimCT-} 获取。