论文
DiT 作为实时渲染器:具有自回归扩散的流视频风格化 Transformer
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
摘要
视频生成模型的最新进展显着加速了视频生成和相关下游任务。其中,视频风格化在沉浸式应用、艺术创作等领域具有重要的研究价值,引起广泛关注。然而,现有的基于扩散的视频风格化方法在处理长视频时难以保持稳定性和一致性,并且其高计算成本和多步去噪使其难以在实际场景中应用。在这项工作中,我们提出了 RTR-DiT(DiT 作为实时渲染器),这是一种基于 Diffusion Transformer 构建的流媒体视频风格化框架。我们首先在策划的视频风格化数据集上微调双向教师模型,支持文本引导和参考引导的视频风格化任务,然后通过具有自强制和分布匹配 蒸馏 的 后训练 将其提炼为几步自回归模型。此外,我们提出了一种保留参考的KV缓存更新策略,不仅能够稳定一致地处理长视频,而且支持文本提示和参考图像之间的实时切换。实验结果表明,RTR-DiT 在文本引导和参考引导的视频风格化任务中,在定量指标和视觉质量方面均优于现有方法,并在实时长视频风格化和交互式风格切换应用中表现出优异的性能。