论文
具有双向提议和验证的交互式策略蒸馏
Interactive-Policy Distillation with Bidirectional Propose-and-Verify
摘要
on-policy蒸馏 (OPD) 通过密集的词元级教师反馈,在其自行生成的轨迹上训练学生模型。然而,幼稚的 OPD 可能会受到教师脱锚的影响,即学生的推理轨迹远离教师,导致教师被询问其几乎不会访问的状态,从而提供不可靠的监督。我们提出交互式策略蒸馏(IPD),它将适应性教师干预应用于学生的展示。在双向提议和验证状态机下,学生和教师交替交换提议者和验证者的角色,并协作生成混合源轨迹。然后根据每个词元的来源进行不同的监管。这种双向的提议和验证机制以及源分割损失使 IPD 不仅是一种性能更高的蒸馏方法,而且成为on-policy和off-policy范式之间的统一桥梁。为了使交错双模型部署更加高效,我们还设计了一种专用的融合推理引擎,将两个模型共同托管在一个具有独立 KV 缓存的服务实例中,并实例化状态机模型来分发、收集和处理请求。在数学推理任务和跨多个师生模型对中,使用 IPD 训练的学生模型不仅优于使用 OPD 训练的学生模型,而且还表现出更高的数据效率。具体来说,当将 Qwen3-30B-A3B 提炼成 Qwen3-1.7B-Base 时,与 OPD 相比,IPD 带来了 +3.28mean@8 和 +3.28best@8 基准平均准确度提升。此外,IPD 仅消耗约 1/4 的训练示例和步骤,优于在整个训练数据集上训练一个 epoch 的 OPD。我们还研究了不同损失变体和接管/交还配置的影响,并证明了 IPD 在不同训练数据上的鲁棒性。