论文

通过批量推测 Jacobi 采样轨迹加速 Visual 同策略 蒸馏

Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts

模型推理批处理与并行

摘要

Visual 同策略 蒸馏 (OPD) 通过学习当前学生生成的轨迹来改进紧凑视觉自回归模型的训练。然而,这些在线轨迹采样仍然是通过自回归解码逐个词元生成的,这给每个 同策略 训练步骤增加了大量成本。推测性雅可比解码(SJD)提供了一种替代方案,因为它可以并行处理多个标记,而无需辅助草案模型,但原始方法是为单序列推理而设计的。我们引入 HB-SJD,这是一个用于视觉 OPD 的批量 SJD 采样轨迹后端。 HB-SJD允许每个图像根据自己的解码进度独立前进,而不同序列位置的图像仍然在批量模型前向中进行验证。镜像完成后,HB-SJD 在完整执行和紧凑执行之间切换,以降低后续轨迹采样的成本。 HB-SJD 仅替换了学生采样轨迹后端,并保持教师、蒸馏 目标和优化程序不变。 LlamaGen 的实验表明,HB-SJD 大大减少了轨迹采样和端到端训练时间,同时保持了蒸馏学生的生成质量。