论文

诊断和缓解同策略自我思维崩溃蒸馏

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

模型训练强化学习

摘要

同策略 Self-蒸馏 (OPSD) 已成为增强和调整 大语言模型 (LLM) 的关键范例。然而,在复杂的推理任务中,OPSD 反而会降低下游性能。在本文中,我们系统地研究了这种病理学,并确定了一个严重的优化陷阱,我们将其定义为 \textbf{Thinking Collapse}——模型的本机中间推理行为急剧下降,通过认知词元密度(ET per 1k)来衡量。通过基于熵的梯度掩蔽和 词元级 目标分析,我们表明这种崩溃是由高学生熵决策叉处的激进教师梯度引发的,其中学生认知标记经常被抑制为教师非认知目标,并且高度集中在高点学生-教师分歧区域。为了解决这种优化病态,我们提出了 \textbf{自适应双视角 OPSD (AD-OPSD)},这是一个强大的控制框架,可以动态调节自我 蒸馏 目标。 AD-OPSD 通过不对称的逐点发散门选择性地将高抑制风险的沙盒词元锚定到从冻结基础模型派生的参考先验,保留本地思维能力,同时保留 OPSD 的纠错能力。跨竞争性数学基准的广泛实验表明,AD-OPSD 在不同模型规模和数据集上比标准 OPSD 提高了高达 \textbf{+4.1\%} 绝对平均精度。进一步的分析表明,AD-OPSD 可以缓解思维崩溃,并可以稳健地推广到不同的 后训练 范式。