论文

用于少步视频生成的参数化轨迹蒸馏

Parametric Trajectory Distillation for Few-Step Video Generation

摘要

视频扩散和流模型需要许多连续评估,使得生成计算成本昂贵。少步蒸馏降低了这种成本,但提出了容量分配问题:学生必须以少得多的顺序计算来匹配教师的迭代生成。现有的轨迹方法要求学生再现在高噪声下高度弯曲的教师过渡,这可能超出其能力并降低精细细节。我们引入了参数轨迹蒸馏(PTD),它让学生将教师轨迹段参数化为多项式,并沿着自己的预测路径从教师指导中学习。 PTD 旨在让学习的曲率​​适应主干网的预测能力,保留运动和多样性。曲率头仅用于训练;推理保留了原始的主干架构。在 Wan2.1-14B 上,四步 PTD 为轨迹蒸馏设定了新的技术水平,与 PDD(该模型上性能最佳的仅轨迹方法)相比,在相同条件下显着提高了动态质量和自然度。 训练设置。在 33B 音视频 MiniMax-H3 上,经过 LoRA 训练的 PTD 比最先进的 LightX2V Turbo 显着提高了多样性和自然度。盲人投票给予 PTD 相对于 PDD 和 LightX2V Turbo 55.1% 和 63.4% 的优先股。项目页面:https://alan-lanfeng.github.io/PTD/.