论文

Flash-OPD:快速 在策略蒸馏

Flash-OPD: Fast On-Policy Distillation

摘要

在策略蒸馏 (OPD) 对学生模型生成的轨迹提供密集的教师模型监督,但生成和评估长执行轨迹会产生大量的训练成本。现有的加速方法通过开环执行轨迹调度或闭环水平适应来降低此成本。然而,监督兼容性在不同轨迹上可能会有很大差异,使得单个执行轨迹水平线难以匹配其异构可靠长度:过短的水平线可能会截断有用的监督,而过长的水平线会浪费可靠区域之外的计算。我们的主要见解是,在生成之前不需要预测特定于轨迹的可靠性边界。通过将可靠性视为累积的低教师模型--学生模型兼容性事件的第一个通道,在采样之前边界本质上是未知的,但可以根据观察到的前缀准确确定是否已达到该边界。基于这一见解,我们提出*Flash-OPD*,它从执行轨迹水平控制转变为自适应轨迹级边界验证。 *Flash-OPD* 将缓存的生成与教师模型验证交错,并根据其观察到的兼容性事件独立停止每个轨迹。为了减少验证开销,最近的事件率仅用于调度下一个验证点,而实际的停止决策始终依赖于精确的累积计数。这种分离可以防止估计错误导致过早终止,同时在生成过程中实现高效的验证。跨不同数据集和教师模型--学生模型设置的大量实验表明,*Flash-OPD* 比标准 OPD 实现了 $2.2\times$--$7.5\times$ 加速,同时保持或提高了准确性。

Flash-OPD:快速 在策略蒸馏的原论文方法或结果图
图 1:从共享执行轨迹水平线到自适应验证。现有的 OPD 加速方法在轨迹采样之前承诺共享视野,当可用长度随轨迹变化时,会导致过早截断或冗余生成; Flash-OPD 在生成过程中验证可靠性,并在其自身边界处淘汰每个轨迹,从而确保可靠性和效率。