论文
SAGA:自回归视频生成的稳定加速指南
SAGA: Stable Acceleration Guidance for Autoregressive Video Generation
摘要
自回归视频扩散可以实现高效的流媒体和长视野视频生成,但重复重用生成的潜在变量作为因果上下文可能会放大时间错误,导致闪烁、运动抖动和结构漂移。在本文中,我们从谱运动学角度研究了这种失效模式,并将离散潜在加速度识别为揭示不稳定高频时间扰动的有效信号。为此,我们提出了 SAGA,一种用于 \textbf{\textit{a}}utregressive 视频生成的 无需训练 \textbf{\textit{s}}table \textbf{\textit{a}}加速 \textbf{\textit{g}}uidance 方法。 SAGA 将基于有限窗口 Slepian 投影的加速域谱制导目标与结构化自回归噪声初始化策略相结合,该策略抑制短程时间相关性,同时保留长程运动结构。无需重新训练或修改主干网,SAGA 可以直接应用于现有的分块自回归扩散模型,这是高质量生成的普遍设置。大量实验表明,SAGA 能够持续提高多个自回归扩散模型的时间质量。在自我强制方面,SAGA 将时间质量从 97.30 提高到 97.91,将图像质量从 69.60 提高到 70.51。此外,光谱分析和人类偏好研究表明,SAGA 减少了时间不稳定性,同时保持了视觉保真度。