论文

学习模仿什么:熵感知分布混合

Learning What to Imitate: Entropy-Aware Distribution Mixing

摘要

小语言模型通常会作为学生根据更强大的教师模型模型的推理轨迹进行后期训练,以有效地学习新技能。然而,对远离学生模型预期分布的迹线的token级模仿通常会产生 \textit{置信冲突},从而要求学生模型模仿它认为不可能(即低概率)的延续,尽管对不同的延续(即处于低熵状态)有信心。为了减轻这些冲突引起的泛化退化和灾难性遗忘,我们提出 熵感知混合:学生模型和教师模型分布的动态每token插值,由学生模型的预测熵进行门控。我们为离线轨迹生成(通过推测解码,然后 SFT)和策略前向 KL 蒸馏实现凸插值和几何插值。我们的结果表明,熵感知混合可以稳定蒸馏,改善分布内和分布外数学推理,同时比固定教师模型监督更好地保留一般能力。尽管如此,最佳熵计划取决于训练源,离线生成的轨迹有利于凹计划(总体教师模型影响更大),而策略训练有利于线性或凸计划(教师模型集中在高熵状态)。

学习模仿什么:熵感知分布混合的原论文方法或结果图
图 1:熵感知混合的概念图。基于熵的插值系数 $\alpha_{t}$ 通过凸 (ConMix) 或几何 (GeoMix) 混合控制从 $\pi_{\theta}$ 到 $\pi_{\mathrm{te}}$ 的偏移。