论文

揭秘 OPD:大语言模型 的长度膨胀和稳定策略

Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models

摘要

同策略 蒸馏 (OPD) 在自己的诱导分布下训练学生模型,同时利用更强大的教师的监督。我们确定了 OPD 的失败模式:随着训练的进行,同策略采样轨迹可能会经历突然的长度膨胀,导致截断的轨迹在训练数据中占主导地位。这种截断崩溃与突然的重复饱和同时发生,并引起有偏差的梯度信号,导致严重的训练不稳定和验证性能急剧下降。我们将此问题归因于学生引发的数据收集与 蒸馏 目标之间的相互作用,该目标隐含地支持过长且重复的采样轨迹。为了解决这个问题,我们提出了 StableOPD,这是一种稳定的 OPD 框架,它将基于参考的发散约束与轨迹混合 蒸馏 相结合。这些共同减轻了重复引起的长度膨胀并进一步稳定了 OPD 训练。在多个数学推理数据集中,我们的方法可以防止截断崩溃,稳定训练动态,并将性能平均提高 7.2%。