论文

用于少步视频生成的不确定性感知一致性蒸馏

Uncertainty-Aware Consistency Distillation for Few-Step Video Generation

摘要

我们研究少步视频生成,即将多步视频生成器提炼为少步学生,这通常需要数十个采样步骤,从而产生大量延迟和计算。一致性蒸馏是一种常见的方法,其中多步骤教师为几步学生提供一致性目标。然而,这些教师指导的目标并不同样值得信赖,而且内容随着时间的推移而快速变化,例如移动的树叶阴影或流动的水,更难学习。我们观察到,监督可靠性取决于内容的局部难度,而不是语义复杂性:变化很小的区域会产生一致的端点预测,而时间变化较大的区域会产生更大的差异,与最大的感知错误一致。受这一观察的启发,我们提出了不确定性感知一致性蒸馏(UACD),它使用局部、无参数的不确定性估计来重新加权每个时空区域的一致性监督。具体来说,我们构建了两条独立扰动的教师引导的一致性路径,其学生端点预测提供了共识目标;学生的直接预测与该目标之间的差异是不确定性代理。然后,我们通过指数权重放宽对高不确定性区域的一致性惩罚,同时在其他地方保留完整的惩罚,因为不能期望学生匹配难以学习的目标。为了在积极减少步骤的情况下保持感知质量,我们将特征空间对抗训练与语义对齐相结合。通过对 50 步 Wan 模型进行参数高效的 LoRA 适配,我们的方法在 VBench 2.0 上实现了最先进的 4 步生成(平均得分为 0.556),并且在用户研究中优于竞争方法。