论文

扩散 Transformer 的重要性感知低秩 蒸馏

Importance-Aware Low-Rank Distillation of Diffusion Transformers

模型优化模型压缩

摘要

Diffusion Transformer (DiTs) 已成为高质量文本到图像生成的主导架构,但其规模对高效部署提出了挑战。虽然截断奇异值分解 (SVD) 是参数减少的原则性工具,但来自 大语言模型 (LLM) 的证据表明,朴素的低秩近似可能会导致灾难性的失败。相比之下,我们发现 DiT 中的截断 SVD 即使在大量全局压缩下也会产生平滑的退化,冗余分布在整个网络的投影矩阵上,而不是集中在几个 Transformer 块中。基于这些见解,我们引入了 SVDtrunc,一种两步块级压缩方案,首先在块之间分配排名,并在全局参数预算下通过截断 SVD 压缩最不重要的块,然后 微调 具有模块化 知识蒸馏 和修正流目标的所有块。我们将 SVDtrunc 应用于 FLUX.dev,压缩级别范围为原始参数计数的 40-90%。在 GenEval、HPSv2 和 DPG 三个基准测试中,我们优于所有竞争方法。值得注意的是,与之前的工作相比,我们保留了 68% 的接近完整性能,并且即使在原始参数预算的 57% 下也保持了竞争力。此外,我们表明 SVDtrunc 补充了步骤 蒸馏,并且即使没有 微调 也能取得强劲的结果,将其定位为大规模生成模型的扩散步骤减少之外的效率改进的实际延续。项目页面:https://vislearn.github.io/SVDtrunc/