论文
并非所有分歧都应该被抑制:同策略 蒸馏 中的反事实可恢复性
Not Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 监督学生访问的轨迹,但基于分歧的规则无法确定错误的前缀是否仍然可纠正。我们将此决策制定为反事实可恢复性,并通过预算匹配的教师延续和回滚分支重播每个错误状态。根据其相对成功程度,状态被分类为可恢复、不可逆但可避免或模糊,这些标签指导训练是否保留、回滚或以传统方式监督相应的轨迹。在 AIME 分支诊断中,可恢复状态的平均持续减去回滚效应为 0.185,不可逆但可避免的状态为 -1.000,这表明了相反的干预偏好。分支衍生的可恢复性代理的 AUC 为 1.000,大大优于单独的散度 0.392。在冻结的评估中,可恢复性控制实现了最强的记录性能,在 AIME2025 上达到了 0.578 的成功率,而最佳基线的成功率为 0.517。它还将 AIME2024-2025 平均@32 从 0.2656 提高到 0.3125,将 GPQA-Diamond 平均@32 从 0.2702 提高到 0.3070。成分消融进一步表明,保留教师可纠正的前缀提供了最大的个人贡献。这些发现将可恢复性确立为 OPD 选择性监督的基于结果的决策变量。