论文

用于推理泛化的几何自蒸馏

Geometric Self-Distillation for Reasoning Generalization

模型训练监督微调与指令调优

摘要

同策略 蒸馏 是 大语言模型 的实用 后训练 配方,为学生自己的轨迹提供密集的教师监督。在特权上下文自我 蒸馏 中,教师和学生是基于相同前缀的同一模型,但教师也可以看到提示或完整的解决方案跟踪。这使得监督变得丰富,但更难信任:教师可以对其特权观点显而易见的延续充满信心,但学生尚无法证明其合理性。 蒸馏 的吸引力在教师和学生意见最不一致的地方最强,并且在多次更新中它会累积成漂移,从而降低分布外 (OOD) 推理能力。我们引入了 GeoSD,一种几何自我 蒸馏 目标,它将这种漂移视为学生预测行为中的运动,并以两种互补的方式抵消它。海林格损失通过学生已经与其共享的重叠来衡量每个教师的偏好,从而削弱了学生尚无法支持的词元的吸引力。由于这些拉力在训练过程中仍然是复合的,因此近端项会惩罚学生的预测与最近检查点的偏离程度(以 Fisher-Rao 距离衡量)。两者都是下一个标记分布的相同几何中的距离,并且自然梯度更新在该几何中而不是在参数空间中进行步骤。在数学推理基准和三个模型系列中,GeoSD 保留了自 蒸馏 的分布内增益,同时将平均 OOD 精度比基本模型提高了 5.7-8.6 个点,并且在从 1.7B 到 32B 的模型尺度上保持增益。分析为什么标准匹配在分布之外失败,我们发现它通过从高熵状态的替代方案中排出质量来赢得老师的同意,从而导致对错误答案的自信一致,而 GeoSD 则使这些替代方案保持在可达范围内。