论文

RLCSD:对比强化学习 同策略 自 蒸馏

RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

模型训练强化学习

摘要

同策略 self-蒸馏 (OPSD) 通过将模型自身的分布与特权上下文下的分布(通常是经过验证的解决方案)对齐,为推理模型提供密集的 词元级 监督。然而,我们表明,由此产生的分配差距集中在风格标记上,而不是承担任务的标记上,因为暗示模型往往会产生更短、更直接的输出。我们将这种病理现象称为\emph{特权引起的风格漂移},它会破坏训练的稳定性并缩短反应时间。为了解决这个问题,我们提出了 \textbf{RLCSD} (使用对比 同策略 Self-蒸馏 的强化学习),它通过将正确提示下的师生差距与错误提示下的师生差距进行对比,抑制由提示引起的风格转变(无论正确性如何),并产生更集中于任务承载标记的信号,从而减轻这种漂移。在 Qwen3 (1.7B/4B/8B) 和 Olmo-3-7B-Think 上进行的数学和逻辑推理实验表明,RLCSD 始终优于 GRPO 和之前的 OPSD 方法,并且在代理任务上的其他结果支持更广泛的适用性。我们进一步证明对比原理是通用的:它插入现有的 OPSD 方法中以改进它们,并且其底层洞察扩展到更广泛的跨模型 同策略 蒸馏。