论文

MobileWan:缩小移动视频传播的质量差距

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

模型优化端侧模型

摘要

视频扩散的最新进展是通过将基于 Transformer 的架构扩展到数十亿个参数来推动的,从而大大提高了视觉保真度和运动连贯性。相比之下,现有的移动视频扩散模型仍然局限于相对较小的参数预算,通常为 0.4-1.8B,限制了生成质量。在这项工作中,我们证明了高质量的移动视频生成不需要小模型。相反,我们证明了服务器规模的 5B 参数视频扩散 Transformer 可以通过循环重构和结构化压缩有效地部署在内存受限的移动硬件上。从 Wan2.2-5B 开始,我们依赖于递归 蒸馏 框架,该框架将视频生成转换为具有恒定内存注意力计算的块式自回归过程。与因果线性注意力相结合,该模型在推理时作为 RNN 运行,同时保持块之间的时间一致性。我们进一步提出了一种可学习的注意力头修剪方法,该方法基于使用噪声偏置稀疏目标和基于 蒸馏 的微调进行端到端优化的二进制每头门。与采样步长 蒸馏 和内存优化 VAE 解码相结合,MobileWan 成为第一个可部署在商用移动设备上的 5B 级视频扩散模型。我们的系统在 20 秒端到端延迟内以 16 FPS 生成 5 秒 480x832 视频,获得 83.79 的 VBench 分数,并建立了移动视频生成的新技术水平。已发布的DiT检查点和示例代码请在项目页面找到:https://qualcomm-ai-research.github.io/MobileWan