论文
Ultra Flash:将实时流视频生成扩展到高分辨率
Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions
摘要
虽然最近的自回归视频扩散模型实现了卓越的流媒体质量,但它们仍然局限于低分辨率(例如 480P),这使得高效、可扩展、实时的高分辨率视频生成成为一个根本性的开放挑战。为了弥补这一差距,我们推出了 Ultra Flash,这是一种能够实时生成高分辨率视频的级联流框架。 Ultra Flash 通过三个关键贡献在单个 GPU 上实现了约 30 FPS(1K 分辨率)和约 18 FPS(2K 分辨率):(1)保留架构的 T2V-to-TV2V 超分辨率训练范式与面向 AIGC 的数据降级管道相结合,可有效保留基础模型的生成能力,在主流低分辨率生成模型后级联时能够增强高分辨率细节; (2)因果流潜在上采样器与高分辨率解码器配对,增强时空一致性,同时实现高效的潜在空间缩放和精确的高分辨率解码,而计算开销可以忽略不计; (3)级联高分辨率流视频生成优化方案,首先执行混合奖励增强稀疏因果化和超分辨率模型的单步蒸馏,然后引入级联流自强迫偏好优化和动态缓存管理,共同增强整体一致性,提高质量,并实现实时高分辨率流视频生成。大量实验表明,Ultra Flash 能够可靠地生成超高分辨率流媒体视频,同时保持最先进的视觉质量和卓越的效率。项目页面:https://xin1u.github.io/UltraFlash/