论文
同策略蒸馏中什么最重要?数据效率与选择的视角
What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection
摘要
同策略蒸馏(OPD)已成为一种广泛采用的训练后范式,用于增强推理领域的大型语言模型。然而,OPD 中以数据为中心的机制仍然相对未得到充分探索。本文对 OPD 中的数据效率和数据选择进行了实证研究。我们首先研究一种极端设置:仅在一个示例上训练 OPD,即 1-shot OPD。令人惊讶的是,我们发现 1-shot OPD 在所有采样的训练示例中始终有效,并且更难的示例通常会产生卓越的性能增益。接下来我们研究是什么真正推动了学生模型在训练数据中的改进。我们的分析表明,这种改进不是由高Token熵驱动的,而是由困难问题自然产生的更长的 CoT 路径驱动的。较长 CoT 的训练有助于在较长的推理范围内与老师保持更紧密的一致,并学习通常在短 CoT 中缺失的批判性思维模式,例如反思(例如“替代”)。基于这些见解,我们提出了一种简单的数据选择方法,仅选择困难的示例进行训练,即使是完全超出教师能力的“无法解决”的示例也可以成功使用。我们对从 1.5B 到 7B 的四个模型进行的实验表明,仅在 8 个选定的困难示例上训练学生模型与 17K 数据集基线的性能相匹配。