论文
PVD:以两个半尺寸专家进行逐阶段速度蒸馏
Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation
摘要
最近基于扩散的图像生成骨干模型的规模大幅增长,使得网络推理成本迅速增加。虽然扩散蒸馏技术可以减少推理步骤的数量,但在单个全 骨干模型 前向计算预算内生成高质量图像仍然具有挑战性。现有的一步法通常将此预算分配给单片 学生模型 的单次评估。然而,用单个整体映射来近似异构从粗到精的传输是很困难的,并且通常会导致输出过度平滑。为了解决这个问题,我们提出了分相速度蒸馏(PVD),它将生成时间线分为粗相和细相,并通过平均速度对每个相内的过渡进行建模。每个阶段都会分配一名专门的半尺寸专家,将结构组成与细节细化分离,同时保持累积计算相当于一次完整的 骨干模型 前向传递。我们证明,使用两个半尺寸特定阶段专家的性能优于单个全尺寸单片 学生模型。在类条件图像生成上,PVD 在 ImageNet 256 x 256 上实现了 1.48 的 FID。在更复杂的文本到图像 (T2I) 任务上,PVD 蒸馏模型(Stable Diffusion 3.5-Medium、FLUX.1-dev、Qwen-Image)产生的结果与其多步教师具有竞争力,显着优于先前的蒸馏方法。此外,在评估的 T2I 骨干模型 中,与相应教师相比,PVD 将活动参数减少了 49.10-50.89%,峰值 VRAM 减少了 45.76-48.36%。源代码和精炼模型可在 https://github.com/PolyU-VCLab/PVD. 获取
