论文

奖励闪电:通过同源偏好快速生成视频 蒸馏

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

摘要

在视频传播模型中同时实现偏好对齐和 蒸馏 加速仍然是一个开放的挑战。现有方法在不匹配的表示空间上优化两个目标,其中改进一个目标通常会损害另一个目标。为了克服这个问题,我们提出了奖励闪电,这是一个统一的框架,可以在单个共享表示中对齐和加速视频传播模型。其核心原则是同源性:两个目标都根据相同的潜在特征进行评估,这减轻了在不相交表示上进行优化时出现的梯度冲突。作为基础组件,我们首先引入潜在奖励模型(LRM),该模型直接在潜在空间中对视频进行评分,而无需解码回像素空间。在 LRM 的基础上,同源偏好 蒸馏 (HPD) 重用这个共享主干来联合执行对抗性 蒸馏 和偏好对齐,产生保持忠实且良好对齐的几步生成器。大量实验表明,LRM 在偏​​好准确度方面超出了像素级和潜在级奖励基线 $11.0\%$ 和 $14.7\%$,并且奖励闪电仅以 $1$ 到 $4$ 的步骤生成高保真视频,将平均 VBench 分数提高了 $2.1\%$,同时在文本对齐、运动质量和视觉质量方面处于领先地位。项目页面:https://reward-lightning.github.io。