论文
揭秘 同策略 蒸馏:角色、病理学和法规
Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
摘要
同策略 蒸馏 (OPD) 已成为 LLM 后训练 的关键范例,但其训练动态仍然知之甚少。我们提出了一项系统研究,探讨 OPD 的作用、病理学和调节。我们首先阐明 OPD 作为探索催化剂的作用:它通过密集的 词元级 指导引导学生走向正确的推理路径,而不扩大能力上限。我们通过证明即时多样性比每个问题的采样数量更重要来证实这一点,并且至关重要的是,OPD 的有效性完全取决于其引导信号的质量。这种依赖性暴露了两种使探索脱轨的病态。当师生分配差距过大导致指导信号与任务正确性不一致,从而将探索引向适得其反的方向时,就会出现师生不匹配的情况。当聚合的 词元级 目标创建依赖于长度的捷径时,就会出现长度利用,允许学生通过响应截断或冗余填充来玩奖励景观,探索退化长度模式而不是推理策略。为了克服这些病症,我们研究了轻量级信号调节:优势剪辑和对数尺度压缩,确保探索由可靠的信号引导。七个基准的实验表明,这些规定减轻了长度利用并实现了有效的 蒸馏,稳定地超越了 OPD 变体和 RLVR 基线,从而证实了良好监管的信号质量,而不仅仅是教师规模,控制着 OPD 的成功探索。