论文

范围:具有双路径自适应加权的信号校准 同策略 蒸馏 增强

SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting

摘要

同策略 强化学习已成为 大语言模型 中推理对齐的主导范例,但其稀疏的结果级奖励使得 词元级 学分分配非常困难。 同策略 蒸馏 (OPD) 通过从教师模型引入密集的 词元级 KL 监督来缓解这一问题,但通常在所有采样轨迹中统一应用这种监督,忽略信号质量的根本差异。我们提出了信号校准的 同策略 蒸馏 增强(SCOPE),这是一种双路径自适应训练框架,可将 同策略采样轨迹通过正确性路由到两个互补的监督路径中。对于不正确的轨迹,SCOPE 执行教师困惑加权 KL 蒸馏,以优先考虑教师表现出真正纠正能力的实例,同时降低不可靠指导的权重。为了获得正确的轨迹,它应用学生困惑度加权 MLE 将强化集中在能力边界处的低置信度样本上,而不是过度强化已经掌握的样本。两条路径都采用组级归一化来自适应校准权重分布,从而考虑到提示之间的内在难度差异。对六个推理基准的大量实验表明,与竞争基准相比,SCOPE 在 Avg@32 中平均相对提高了 11.42%,在 Pass@32 中平均相对提高了 7.30%,证明了其一致的有效性。