论文

PixelWizard:在超大空间分辨率下实现高效的高保真视频生成

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

模型推理推理加速

摘要

高分辨率视频生成面临优化不稳定和计算成本过高的双重瓶颈。词元序列的大规模扩展不仅会以全局一致性为代价偏向局部纹理优化,导致结构崩溃,而且还会带来高昂的训练成本和严重的推理延迟。为了解决这个问题,我们提出了 PixelWizard,一个将全局结构建模与细粒度细节合成分层解耦的框架。 PixelWizard 首先建立一个紧凑的时空锚点来集中密集的结构先验,然后指导高分辨率的细粒度生成。这减轻了局部优化偏差,以确保结构稳定性而不影响高频细节。利用这种结构稳定性,我们引入噪声跨度对齐快捷训练来打破推理瓶颈。通过显式地对步长进行建模,该机制允许模型以大步长遍历生成轨迹。至关重要的是,我们结合了指数索引偏置采样和自适应噪声跨度校准,使优化与高分辨率网格的移位噪声计划保持一致,确保稳健的几步推理,而不会产生 蒸馏 的沉重开销。大量实验表明,PixelWizard 实现了卓越的视觉质量,同时将原生 2K/4K 视频的生成采样速度提高了 10 倍以上。