论文
用于生成真实自回归视频的测试时噪声引导适应
Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
摘要
自回归视频扩散模型可以通过消除对未来帧的条件来生成任意长的视频,从而大大提高了计算效率。然而,随着时间的推移,它们会遭受误差积累,因为去噪序列逐渐偏离训练期间看到的条件分布。最近的进展试图通过将每个生成的帧锚定到学习到的真实帧流形来减少这种错误。然而,即使所有生成的单独帧都接近真实流形,模型也缺乏足够的知识来继续执行某些轨迹而不退出它,从而到达终点。为了防止模型陷入终点,我们从以下假设开始:对于建模良好的未来轨迹,预测噪声的分布应与前向噪声过程的分布相匹配。为了在测试时强制执行这样的先验,我们引入了通过噪声引导优化(TANGO)来避免终点点,它使用扩散模型作为其自身输出的批评者,通过预测向前一步并要求各向同性高斯噪声预测。我们利用与预期噪声分布的偏差来搜索不会到达终点的替代轨迹。与最先进的技术相比,我们的方法在 VBench 上实现了 3.1\%$ 的绝对改进,同时在 15$s 视频中平均将 Fréchet 视频距离减少了 $28.3\%$。我们的代码可在 https://mever-team.github.io/tango 上找到。