论文

超越教师的可能性:用于长上下文推理的团体校准 同策略 蒸馏

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

摘要

同策略 蒸馏 (OPD) 使用更强老师提供的密集 词元级 指导来训练学生自己的反应。然而,在长上下文任务中,词元级 教师支持可以支持局部合理的响应,从而忽略分布在输入中的证据或违反全局任务约束。相反,特定于任务的验证者在响应级别评估任务完成情况,并可能返回反映部分成功的分级奖励。我们根据两个代表性长上下文证据聚合任务的固定响应来诊断这种不匹配。在较长的输入范围内,轨迹级 OPD 分数与验证者奖励的一致性逐渐降低,表明教师与验证者之间存在分歧。受此观察的启发,我们引入了组校准 同策略 蒸馏 (GC-OPD)。 GC-OPD 分别对每个采样轨迹组内的验证者奖励和轨迹级 OPD 分数进行标准化,并将它们的差异用作带正负符号的教师-验证者分歧残差。基于相对优势的信用分配 (RACA) 根据其相对 OPD 优势在词元之间分配轨迹级残差,同时保留原始 OPD 信号。在五个长上下文基准测试中,具有 GC-OPD 的 后训练 将官方 Qwen3-4B 和 Qwen3-8B 检查点的五个基准平均值分别从 29.08 提高到 40.47,从 35.12 提高到 44.65。在相同设置下,原版 OPD 分别达到 39.31 和 43.56。受控消融表明,签名残差比附加的 OPD 派生项或直接组归一化验证者奖励添加更有效,而 RACA 比统一词元分配进一步改进。总之,这些结果表明,组相对残差校准可以纳入验证者结果,而无需放弃密集的 词元级 指导。代码可在 https://github.com/SolereZhang/GC-OPD 获取。