论文
反馈对齐在自蒸馏中的角色
The Role of Feedback Alignment in Self-Distillation
摘要
根据其他上下文(例如对先前尝试的反馈)调节语言模型通常可以提高其响应。自蒸馏训练模型在上下文不存在时保留这种改进。该方法的工作原理是在两种设置下匹配模型的输出分布:仅看到问题的学生和也看到上下文的自学者。因此,模型学习的内容取决于自学者接收到的上下文,但这种上下文的设计在很大程度上仍未被探索。我们通过根据冻结评论家的反馈训练求解器来研究自我蒸馏的上下文设计。我们比较三个条件:(i)二元奖励(GRPO),(ii)参考解决方案,以及(iii)与求解器推理轨迹一致的逐步批评。步调一致的批评产生了最大的收益,比 GRPO 好 16.11 点,比参考解决方案条件自蒸馏好 5.27 点 (Avg@12)。每个令牌的优势分析揭示了原因:步骤一致的反馈仅针对推理失败的令牌,而完整地保留正确的行为。相比之下,以参考解决方案为条件会迫使模型在每个标记(甚至是正确的步骤)上改变其行为,因为替代推导不可避免地在措辞和方法上有所不同。这表明反馈和求解器推理之间的结构一致性是自蒸馏有效性的关键驱动因素。
