论文

PVD:以两个半尺寸专家进行逐阶段速度蒸馏

Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation

摘要

最近基于扩散的图像生成骨干模型的规模大幅增长,使得网络推理成本迅速增加。虽然扩散蒸馏技术可以减少推理步骤的数量,但在单个全 骨干模型 前向计算预算内生成高质量图像仍然具有挑战性。现有的一步法通常将此预算分配给单片 学生模型 的单次评估。然而,用单个整体映射来近似异构从粗到精的传输是很困难的,并且通常会导致输出过度平滑。为了解决这个问题,我们提出了分相速度蒸馏(PVD),它将生成时间线分为粗相和细相,并通过平均速度对每个相内的过渡进行建模。每个阶段都会分配一名专门的半尺寸专家,将结构组成与细节细化分离,同时保持累积计算相当于一次完整的 骨干模型 前向传递。我们证明,使用两个半尺寸特定阶段专家的性能优于单个全尺寸单片 学生模型。在类条件图像生成上,PVD 在 ImageNet 256 x 256 上实现了 1.48 的 FID。在更复杂的文本到图像 (T2I) 任务上,PVD 蒸馏模型(Stable Diffusion 3.5-Medium、FLUX.1-dev、Qwen-Image)产生的结果与其多步教师具有竞争力,显着优于先前的蒸馏方法。此外,在评估的 T2I 骨干模型 中,与相应教师相比,PVD 将活动参数减少了 49.10-50.89%,峰值 VRAM 减少了 45.76-48.36%。源代码和精炼模型可在 https://github.com/PolyU-VCLab/PVD. 获取

PVD:以两个半尺寸专家进行逐阶段速度蒸馏:论文原图
图 3:分相速度蒸馏 (PVD) 概述。 (a) 从 教师模型 中提取半尺寸的 骨干模型,并通过流匹配进行微调以初始化本地学生。 (b) 通过跨分区时间间隔的平均速度学习来提取特定阶段的 LoRA 专家。 (c) 对于 T2I 任务,使用阶段判别器来提供对抗性细化。