论文

近策略:通过异步生成和选择性打包加速 同策略 蒸馏

Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing

摘要

自回归模型的标准 知识蒸馏 通常会遇到分布不匹配的问题。虽然 同策略 方法通过利用学生生成的输出来缓解这一问题,但它们依赖于计算成本高昂的强化学习 (RL) 框架。为了提高效率,我们提出了近策略 蒸馏 (NPD),这是一种将学生生成与训练分离的异步方法。此重新制定使受监督的 微调 (SFT) 能够进行序列打包。然而,异步更新不可避免地会引入策略滞后和样本噪声,这可能导致行为从近策略向 离策略 漂移。为了在不牺牲效率的情况下解决这个问题,NPD 集成了稀疏学生更新和 $Δ$-IFD 过滤机制,这是一种启发式样本选择机制,可以凭经验稳定优化轨迹。通过过滤极端分布外的样本,$Δ$-IFD 可以防止噪声主导梯度,确保更新保持在安全的近端学习区域内。根据经验,NPD 框架比 同策略 基线实现了 8.1 倍的加速,并且比 SFT 提高了 8.09%。至关重要的是,通过有效缩小后续 RL 的探索空间,我们的方法使 openPangu-Embedded-1B 达到了 68.73% 的最先进分数,优于大得多的 Qwen3-1.7B。代码即将发布。