论文
消极自我-蒸馏:通过避免缺陷来学习推理
Negative Self-Distillation: Learning to Reason by Avoiding Flaws
摘要
同策略 Self-蒸馏 (OPSD) 已成为 大语言模型 (LLM) 自我完善的流行范例,允许模型通过利用 真值 解决方案等特权信息来充当自己的老师。然而,最近的研究结果表明,OPSD 会严重降低 LLM 在复杂推理任务上的表现:通过强迫学生模仿以特权信息为条件的人为自信的推理轨迹,OPSD 无意中抑制了不确定性的表达,并惩罚了解决挑战性问题所需的探索性、自我纠正行为。为了解决这个问题,我们引入了 Negative Self-蒸馏 (NSD),这是一个新框架,它通过偏离有缺陷的推理而不是模仿特权解决方案来优化 LLM。 NSD 不依赖 真值 答案或外部监督,而是使用模型本身生成特定于问题的负面条件(例如,充当“粗心的推理者”),并将学生的分布推离这个自我生成的负面老师。天真地应用遗忘目标来实现这种分歧是有问题的,因为有缺陷的推理标记与基本语言标记混淆了;不加区别地惩罚这两种风险可能会灾难性地降低模型的基础语言能力。我们通过设计一种动态门控机制来解决这个问题,该机制可以自动识别和隔离推理关键标记,确保梯度更新仅针对行为缺陷,同时保留模型的语言先验。根据经验,NSD 始终优于 OPSD 和其他无标签、自引导强化学习 (RL) 基线。