论文

CineMobile:用于电影摄影机运动生成的设备上图像到视频扩散

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

模型优化模型压缩

摘要

移动设备上对图像到视频创作的需求不断增长,越来越关注电影运动效果,如子弹时间、移动变焦、慢动作等。虽然 Diffusion Transformer (DiTs) 在视频生成方面表现出强大的性能,但其大参数大小和多步迭代去噪过程导致大量的计算开销,使得在移动设备上高效生成具有挑战性。我们建议 CineMobile 来弥补这一差距。具体而言,CineMobile 采用了三重优化策略:(1)利用 蒸馏 引导的修剪方法来导出紧凑而高效的模型,保留电影效果所需的基本视频生成功能; (2)通过扩散蒸馏和强化学习的结合,将压缩模型优化为4步生成器; (3) 采用混合 后训练 量化策略将模型占用空间压缩到 1 GB 以下。实验结果表明,与采用 Wan 2.1 架构的教师模型相比,CineMobile 的生成速度提高了 40 倍,同时保持了相当的视觉质量。具体而言,CineMobile 在 NVIDIA H200 GPU 上生成 49 帧 480p 视频,每步去噪延迟为 0.6 秒,在联发科天玑 8400 Ultimate 5G 平台上为 20 秒,峰值内存使用量为 1.8 GB,展示了其在移动图像到视频创作中的实际适用性。