论文

同策略 蒸馏 的分块策略漂移门控

Blockwise Policy-Drift Gating for On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 使用根据学生本身采样的轨迹计算出的教师信号来训练学生策略。最近的工作表明,采样词元 OPD 在长期推理任务中可能很脆弱,而本地教师支持匹配是一种简单而有效的修复。本文介绍了块式策略漂移门控,这是一种轻量级的仅限学生使用的旧策略与当前策略漂移控制器,用于轨迹复用下的 OPD。该方法计算采样词元路径上行为学生和当前学生之间的对数概率变化,在固定块或跨度上聚合这些变化,并使用所得的分离的均值归一化门来重新加权 OPD 位置损失。它不会改变教师目标、教师 top-K 支持或采样轨迹政策。在六变体 Qwen3 数学推理基准测试中,所有训练变体都有统一的 200 步训练预算,我们使用 pass@8 作为主要问题级解决率指标。固定的 64 个词元块门控将 AIME24、AIME25、MATH500 和 AMC23 中的采样词元 OPD 平均 pass@8 从 0.4978 提高到 0.5160。在 Teacher-TopK/LSM 上,Block64 在受过训练的学生中给出了最佳的四基准平均 pass@8。结果将本地旧的当前策略漂移确定为重用 OPD 采样轨迹的实用控制信号,并激励块级门控作为提高求解率鲁棒性的简单默认值。