论文

电视监管的 OPD:同策略 蒸馏 中的方向很重要

TV-Regulated OPD: Direction Matters in On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 有助于在 大语言模型 (LLM) 的 后训练 阶段将知识从领域专家转移到学生。然而,主流OPD方法中的监督信号存在高方差和噪声,在训练过程中通常不稳定。在这项工作中,我们系统地研究了对性能真正重要的因素以及训练期间不稳定背后的基本机制。我们发现,仅保留 词元级 优势的符号就足以实现与标准 OPD 相当的性能。同时,更平滑和有界的优势可以稳定训练过程而不牺牲其性能。这些促使我们利用总变分 (TV) 形成优势,并提出一种稳健的 TV 调节 同策略 蒸馏 (TV-OPD) 方法。受益于有限和递减的优势,TV-OPD 表现出稳定的训练动态和稳定的后期表现。我们进行了全面的实验,发现在各种设置下,TV-OPD 在训练后期始终取得更好的性能和更低的方差。