论文

基石还是绊脚石?破译 同策略 蒸馏 中的 Rock 词元

Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation

摘要

虽然最近关于可验证奖励的强化学习 (RLVR) 的研究表明,一小部分关键词元不成比例地驱动推理增益,但对 同策略 蒸馏 (OPD) 的类似 词元级 理解在很大程度上仍未得到探索。在这项工作中,我们研究了高损失词元,这是一种词元类型,作为 OPD 每个词元 KL 目标下学生与教师不匹配的最直接信号,根据现有研究,随着训练的收敛,这种词元类型应该逐渐减少;然而,我们的实证分析表明并非如此。即使在 OPD 训练达到明显饱和之后,很大一部分词元仍继续表现出持续的高损失;这些词元(我们称之为 Rock 词元)最多可占生成输出中词元的 18%。我们的调查揭示了两个令人震惊的悖论。首先,尽管它们的高出现频率在总梯度规范中提供了不成比例的大份额,但 Rock 词元本身在整个训练过程中仍然停滞不前,抵制教师驱动的纠正。其次,通过因果干预,我们发现这些标记对模型的实际推理性能的功能贡献可以忽略不计。这些发现表明,大量的优化带宽花费在学生模型无法或不需要内化的结构和话语残差上。通过解构这些动态,我们证明战略性地绕过这些“绊脚石”可以显着简化对齐过程,挑战统一词元权重的必要性,并为大规模模型 蒸馏 提供更有效的范例。