论文

EOS词元不一致如何导致同策略蒸馏中的回答过长

When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

摘要

我们研究了同策略蒸馏(OPD)中的长度膨胀,其中学生的回答可能变得过长,甚至耗尽了生成预算。我们认为基础学生和经过训练的教师之间的\emph{终止词元不匹配}是这种行为的重要根源。在 Qwen3、Llama 和 Gemma 中,这两个模型可以将其停止概率置于不同的 EOS 词元上,即使它们声明的停止集相同。这种不匹配会抑制学生首选的终止操作,而无法可靠地转移教师首选的替代方案。我们表明,单独对齐解码停止集是不够的,而将功能等效的 EOS 词元视为共享语义停止操作可以大大减轻所有三个模型系列中不匹配引起的长度膨胀。为了进一步了解终止行为在训练过程中如何演变,我们研究了不同 K2-Horizo​​n 训练阶段的 OPD。这种分阶段分析表明,终止偏好在训练过程中可能会发生重大变化,同时还揭示了 OPD 运行后期明显的长度膨胀,这种膨胀在终止对齐之外持续存在。总之,这些结果表明终止不匹配是 OPD 长度动态的一个重要但并非详尽的来源。我们发布了一个包含提议的终止处理更正的实现。