论文
内存高效 无需训练 通过 BaryCache 加速扩散 Transformer
Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache
摘要
Diffusion Transformer 实现了高保真图像和视频生成,但其迭代采样仍然昂贵,因为每个去噪步骤都需要大型矩阵运算。现有的基于缓存的加速减少了冗余计算,但通过存储中间状态增加了 VRAM 占用空间,这可以直接限制推理批量大小。在这项工作中,我们提出了一种 无需训练 加速方法,该方法使用重心外推器对 DiT 采样执行逐步预测。通过利用重心外推法,我们的预测器在数值上是稳定的,并减轻了类似于前向预测期间的龙格现象的振荡伪影。通过对图像和视频生成的大量实验,我们的方法在内存使用和感知质量之间提供了有利的权衡,同时与基线 DiT 推理相比,端到端采样速度提高了 3.30 倍。