论文
FlashDecoder:采用 Transformer 的实时潜在像素流解码器
FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers
摘要
实时视频生成需要快速解码和快速去噪,但当前的潜在视频扩散模型依赖于 3D 卷积解码器,这些解码器在高分辨率或长视频下速度缓慢且占用大量内存。我们推出 FlashDecoder,这是一种快速、内存高效的纯 Transformer 视频解码器,可将潜在帧逐帧解码为像素。在每一步中,当前帧仅通过滚动 KV 缓存关注过去帧的固定大小窗口。无论视频长度如何,固定时间窗口都可以保持快速解码和内存限制,从而实现恒定延迟流。由于帧是按顺序处理的,因此无需显式注意掩模即可强制执行时间因果关系,从而能够以高达 1080p 的分辨率进行训练并匹配卷积解码器的重建质量。在 Wan2.1 和 Wan2.2 潜在空间上,FlashDecoder 在重建质量方面与每个卷积解码器相匹配(例如,1080p 时 41.55dB 与 41.49dB PSNR),同时在单个 H100 GPU 上解码速度提高 3.6 倍至 4.7 倍,内存减少多达 11 倍。通过架构感知推理优化,加速率扩大至 12 倍。