论文

迈向无错误的长视频生成

Towards Error-Free Long Video Generation

模型架构Transformer

摘要

视频生成领域的最新进展使得分钟级合成成为可能;然而,由于错误累积、属性漂移和长视频数据的有限可用性,生成长视频仍然具有挑战性。在本文中,我们介绍了一种无限长视频生成框架,专注于解决这些问题并生成高质量、动态且身份一致的单镜头长视频。我们首先将扩散模型微调为大规模短视频数据上的视频扩展模型,以自回归生成时间相干的剪辑。受到 大语言模型 (LLM) 成功的启发,我们采用剪辑之间的因果注意力计算来进一步在长视频数据上微调该模型。这样,一个剪辑(短视频)中的 token 是通过双向注意力计算的,而剪辑之间的 token 是通过单向注意力计算的。这种设计利用了现代扩散模型的优势,同时保留了长期上下文信息,有效地减轻了错误累积和属性漂移。为了在推理过程中实现内存效率,我们采用键值(KV)缓存机制来维持恒定的KV内存。此外,我们引入截断校正流(T-RFlow)技术来进一步抑制误差累积。实验结果证明了我们方法的有效性。我们的框架为逼真且连贯的分钟级视频合成建立了新的基准。