论文

SpecLoR:用于运动相干文本到视频生成的频谱前瞻校正

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation

模型推理解码与生成控制

摘要

流匹配通过潜在 ODE 采样实现了强大的文本到视频生成。然而,速度近似和数值离散误差不可避免地会累积,导致采样轨迹漂移。因此,生成的视频经常出现严重的时空不一致。然而,直接纠正这些漂移的、有噪声的潜在特征是具有挑战性的:(i)时间步长相关的噪声掩盖了可靠的结构线索; (ii) 空间干预可能会破坏复杂的局部几何形状,同时产生大量的计算成本。为了解决这个问题,我们提出了频谱前瞻校正(SpecLoR),这是一种即插即用的推理方法,通过前瞻预测绕过噪声,并通过将校正转移到频域来规避时空纠缠,在频域中可以轻松获得自然视频的通用统计先验。首先,在早期采样阶段,SpecLoR 会向前估计干净的潜在 $z_{t,0}$ 并计算其 3D 时空频谱。接下来,SpecLoR 校正幅度谱以匹配先前的幅度谱,保持相位不变。最后,对校正后的状态重新进行噪声处理以恢复 ODE 积分。 Wan2.2 上的实验表明,SpecLoR 显着减少了物理伪影,并以最小的计算开销(4 个额外的 NFE)增强了跨多个基准的运动一致性。