论文

StreamingEffect:实时以人为中心的视频效果生成

StreamingEffect: Real-Time Human-Centric Video Effect Generation

摘要

流媒体视频效果生成对于电子商务流媒体、娱乐和视频博客等以人为中心的实时应用程序来说是非常理想的,但由于缺乏合适的数据和可部署的编辑模型,仍然很困难。与通用视频生成不同,此任务需要实时视频到视频编辑,在保留人类身份、背景内容和时间一致性的同时添加表现力效果。现有的加速工作主要集中在文本到视频的生成上,而用于视频编辑的高效 蒸馏 在很大程度上仍未得到充分探索。在本文中,我们提出了 \textbf{StreamingEffect},一个以人为中心的实时流视频效果框架。我们采用上下文视频编辑架构并训练高质量的双向教师,然后将其提炼为因果自回归学生,并进一步将采样从 50 个步骤减少到 4 个步骤。我们还引入了关键帧控制,允许在线注入参考效果帧并通过流传播以进行交互式编辑。为了解决数据瓶颈,我们构建了 \textbf{VideoEffect-130K},据我们所知,最大的以人为中心的视频效果数据集,包含来自短视频和编辑平台的 600 个效果类别的 70K 效果视频和 60K 编辑视频。实验表明,我们的方法可以在单个 H200 GPU 上实现实时、高质量的 720p 视频编辑。