论文

插值策略蒸馏:离策略和在策略蒸馏之间的可控连续体

Interpolated Policy Distillation: A Controllable Continuum Between Off-Policy and On-Policy Distillation

摘要

off-policy和on-policy蒸馏传统上被制定为单独的范式,每个范式都有利于蒸馏轨迹的不同属性。教师生成的(非策略)跟踪通常是高质量的,但与学生的分布相距甚远,而学生生成的(策略内)rollout更容易学习,但通常包含错误的推理。我们将这些范例视为政策连续体的端点,并假设更有效的rollout政策可能介于两者之间。我们引入插值策略蒸馏(IPD),它将每个解码步骤的下一个词元分布定义为学生和教师分布之间的显式线性插值。插值在分布级别上逐个词元进行操作,其系数可以直接控制轨迹质量和学生可学习性之间的平衡。单纯地从该策略中进行采样将需要在每个标记处顺序查询教师,因此成本高昂。为了使 IPD 实用化,我们使用新的推测解码规则对其进行加速,同时准确保留插值的下一个词元分布。在轨迹级别,最终的rollout自然会交错学生和教师生成的片段。然而,与最近的启发式段交织方法不同,这种交织是由精确实现的词元级插值策略而不是手工设计的切换规则引起的。在纯文本和多模态推理基准中,IPD 始终优于端点策略(SFT 和 OPD)、传统的两阶段组合(SFT-then-OPD)以及最近的启发式段交错方法,这表明词元级策略插值更好地平衡了轨迹质量和学生的可学习性。