论文
Φ-噪声:通过基于相位的噪声处理进行 无需训练 时态视频调节
Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation
摘要
潜在视频扩散模型通过逐步将高斯噪声转换为以文本或视觉输入为条件的真实样本来生成视频。然而,现有的调节方法通常需要额外的训练和计算开销。受最近关于生成模型中频率分量重要性的发现的启发,我们提出了一种简单的 无需训练 方法,通过将参考视频中的低频相位信息直接注入到扩散噪声潜伏中来生成运动条件视频。我们的方法无需修改模型架构或推理管道即可传输运动线索。使用多个应用程序,我们展示了对生成视频中的外观和动态的有效控制,同时与更复杂的调节方法相比,获得了有竞争力或更好的结果。