论文

E$^2$-OPSD:抑制 在策略自蒸馏中的熵超调

E$^2$-OPSD: Taming Entropy Overshoot in On-Policy Self-Distillation

摘要

在策略自蒸馏 (OPSD) 提供密集的token级监督,无需第二个模型:一个网络充当具有参考解决方案的教师模型和仅具有问题的学生模型。我们确定了该配方的特定故障模式。在训练期间,学生模型token熵上升超过教师模型并保持升高状态,这种模式我们称为熵超调。我们将其追溯到蒸馏的两侧。参考条件教师模型在其答案导向推理路径上充满信心,但这种信心很难转移到学生模型生成的前缀,使其监督过度依赖于特定于答案的线索,而不是可重用的推理模式;同时,OPSD 使用的前向 KL 不断扩散学生模型的预测分布,而不将其拉回。我们引入 E$^2$-OPSD 来解决这两个原因。范例引导教学用检索到的已解决的邻近问题替换当前答案,提供可转移的推理指导,而无需透露目的地,并更好地匹配学生模型可达状态。熵感知蒸馏使用学生模型-教师模型熵间隙来确定每个token校正的方向和强度。 E$^2$-OPSD 与 OPSD 相比,在mean@16 中的数学推理能力提高了高达 4.3 分,而域外评估显示,与相应的基本模型相比,在mean@16 中提高了高达 4.9 分,在 pass@8 中提高了 5.5 分。尽管取得了这些进展,E$^2$-OPSD 仍然很简单,不需要额外的前向传递或网络。

E$^2$-OPSD:抑制 在策略自蒸馏中的熵超调的原论文方法或结果图
图 3:E2-OPSD 概述。