论文
Anti-Self-蒸馏 通过逐点互信息进行推理 RL
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
摘要
同策略 self-蒸馏,其中学生被拉向以特权上下文(例如,经过验证的解决方案或反馈)为条件的自身副本,为在没有更强大的外部教师的情况下提高推理能力提供了有希望的方向。然而,在数学推理中,即使相同的方法在其他地方取得了成功,收益也是不一致的。逐点互信息分析将失败追溯到特权上下文本身:它增强了教师对解决方案已经暗示的标记(结构连接词、可验证的主张)的信心,并削弱了对驱动多步骤搜索的深思熟虑标记(“等待”、“让”、“也许”)的信心。我们提出 Anti-Self-蒸馏 (AntiSD),它会提高学生和教师之间的分歧,而不是降低它:这反转了每个词元的符号,并一步产生自然有限的优势。一旦教师熵崩溃,熵触发门就会禁用该术语,从而完成默认自我 蒸馏 的直接替换。在数学推理基准上从 4B 到 30B 参数的五个模型中,AntiSD 以减少 2 到 10 倍的训练步骤达到 GRPO 基线的准确性,并将最终准确性提高高达 11.5 个百分点。 AntiSD 开辟了一条可扩展的自我改进之路,其中语言模型通过其训练信号引导自己的推理。