论文
WDL-OPD:通过混合约束协同训练弱驱动 同策略 蒸馏
WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training
摘要
同策略 蒸馏 (OPD) 将学生与教师在从学生本身采样的轨迹上对齐,从而减少离线 蒸馏 的训练测试状态不匹配。然而,相同的反馈循环可能不稳定:每次更新都会改变策略和计算下一次更新的状态。我们引入了 WDL-OPD,一种具有两个可训练策略的混合约束协同训练方法。锚定策略生成每条执行轨迹,辅助策略评估相同的访问状态,并且它们的词元分布的几何混合通过反向 KL 与冻结的教师相匹配。两种策略都有梯度。我们表明,冻结辅助恢复了与 OPD$^2$ 和 W2S-OPD 密切相关的锚加对比度代理目标,而联合训练创建了静态增量无法表达的分支级自由度。在 1.7B 和 4B 尺度下记录的 Qwen3 实验中,WDL-OPD 在四个尺度域设置中的每一个中都产生最强的学生检查点。它将 MATH500 精度在 4B 时从 0.630 提高到 0.685,在 1.7B 时从 0.521 提高到 0.585。在代码生成中,七个单策略 OPD 配置表现出熵增长或轨迹退化,而协同训练则达到独立重新评估的开发分数 0.637 和 0.375。由于几次比较在课程或初始化方面有所不同,因此这些结果支持稳定假设而不是普遍因果主张。我们提供测试该假设所需的精确训练算法、失败证据和受控比较矩阵。