论文
联合对齐和 蒸馏 通过样本引导分布匹配生成视频
Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching
摘要
使视频生成模型与人类偏好保持一致在很大程度上依赖于强化学习(RL),而强化学习会产生大量的计算开销。现有的工作流程通常将 RL 和 蒸馏 视为断开连接的阶段:在 蒸馏 之前应用 RL 会产生过高的计算成本,而在 蒸馏 之后应用 RL 经常会导致模型崩溃。为了克服这些限制,我们提出了一个基于分布匹配(DM)的统一、单阶段优化框架。在标准DM框架中,蒸馏通过梯度方向更新模型,最大限度地减少真假模型之间的差距,引导各代人走向清晰度和高保真度。在此基础上,我们引入了 DM-Align,它派生出互补的梯度方向来引导模型朝向人类偏好的样本。受 DPO 和 GRPO 的启发,我们的方法利用分布差距(由偏好对或组内探索制定)来直接构建这种偏好引导的梯度。通过协同这两个梯度方向,我们的方法消除了传统强化学习中固有的多步奖励评估和复杂的 ODE-SDE 转换的需要。跨多个基础视频模型的综合实验表明,这种样本引导框架可以稳健地增强 蒸馏 质量和偏好对齐,始终优于独立变体和顺序两阶段管道。