论文

对比 同策略 蒸馏

Contrastive On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 在从其自己的策略采样的轨迹上训练学生模型,通过最小化每个标记上教师和学生的输出分布之间的差异来提供密集的 词元级 监督。尽管现有的 OPD 方法有效地将强大的推理能力提炼到学生模型中,但它们本质上继承了未经策划的思维链痕迹,加剧了过度思考和推理冗余。为了解决这一限制,我们引入了 COPD,一种对比性 OPD 框架。具体来说,对于学生生成的每个标记,冻结的教师会在两个对比提示下评估当前的学生状态,这两个提示分别会引起低和高的推理努力。由此产生的对数概率差异可作为 词元级 优势信号来指导策略更新。 COPD 不是仅仅模仿单个教师分布,而是引导学生模型获得简洁有效的推理策略。我们通过涵盖推理和理解任务的 9 个多模式基准评估 COPD。实证结果表明,COPD 在不损害任务性能的情况下大幅缩短了推理长度,从而持续提高了不同任务和模型规模的效率。此外,这种对比范式自然延伸到 同策略 self-蒸馏 (OPSD),建立自我对比监督信号,使单个模型能够在没有外部教师的情况下压缩自己的推理。