论文
LongLive-Plug:视频生成的一次性蒸馏
LongLive-Plug: Once-for-All Distillation for Video Generation
摘要
视频扩散模型越来越多地发展为用于各种下游任务的专用模型,并且这种发展通常包括蒸馏阶段,例如加速采样或改进长视频生成。通常每个专用模型都会重复此阶段。我们引入了 LongLive-Plug,这是一个每个骨干系列只蒸馏一次的框架,它在基本模型上学习 LoRA形式的可复用能力,从而无需再次训练,即可即插即用地部署到兼容的下游模型。这些功能包括单次前向的无分类器引导、少步采样以及用于自回归生成的长上下文错误校正。即使下游模型添加调节分支、扩展输出通道,适配器仍可重复使用。尽管以固定的指导尺度进行训练,但我们专用的 CFG LoRA 通过其推理权重提供文本指导控制。将其与少步 LoRA 相结合,同时保留了少步生成和 CFG 对下游任务的可控性。我们验证了跨三个骨干系列和八个任务类别的 54 个下游模型的免训练部署,包括世界建模、机器人、编辑和多模态生成。该方法可以支持其他兼容模型。因此,每种功能可以在每个主干系列中提取一次并重复使用,而无需针对每个目标进行重新训练。
