论文

LongLive-Plug:视频生成的一次性蒸馏

LongLive-Plug: Once-for-All Distillation for Video Generation

摘要

视频扩散模型越来越多地发展为用于各种下游任务的专用模型,并且这种发展通常包括蒸馏阶段,例如加速采样或改进长视频生成。通常每个专用模型都会重复此阶段。我们引入了 LongLive-Plug,这是一个每个骨干系列只蒸馏一次的框架,它在基本模型上学习 LoRA形式的可复用能力,从而无需再次训练,即可即插即用地部署到兼容的下游模型。这些功能包括单次前向的无分类器引导、少步采样以及用于自回归生成的长上下文错误校正。即使下游模型添加调节分支、扩展输出通道,适配器仍可重复使用。尽管以固定的指导尺度进行训练,但我们专用的 CFG LoRA 通过其推理权重提供文本指导控制。将其与少步 LoRA 相结合,同时保留了少步生成和 CFG 对下游任务的可控性。我们验证了跨三个骨干系列和八个任务类别的 54 个下游模型的免训练部署,包括世界建模、机器人、编辑和多模态生成。该方法可以支持其他兼容模型。因此,每种功能可以在每个主干系列中提取一次并重复使用,而无需针对每个目标进行重新训练。

LongLive-Plug:视频生成的一次性蒸馏:图1:通过额外的CFG-only LoRA解耦引导控制。(a)缩放单个蒸馏LoRA会改变整个更新,包括已学引导与少步生成行为。(b)加入独立赋权的CFG-only LoRA,可以在保持少步适配器权重固定的同时,针对各目标调整引导。箭头颜色与宽度示意引导兼容性,其中颜色最暖的耦合迁移箭头对应CFG 55。缩放CFG-only LoRA可提供可调整的引导控制。
图1:通过额外的CFG-only LoRA解耦引导控制。(a)缩放单个蒸馏LoRA会改变整个更新,包括已学引导与少步生成行为。(b)加入独立赋权的CFG-only LoRA,可以在保持少步适配器权重固定的同时,针对各目标调整引导。箭头颜色与宽度示意引导兼容性,其中颜色最暖的耦合迁移箭头对应CFG 55。缩放CFG-only LoRA可提供可调整的引导控制。