论文
LayerCache:利用逐层速度异构性进行高效的流匹配推理
LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
摘要
流匹配模型实现了最先进的图像生成质量,但由于通过大型 Transformer 网络进行迭代去噪,会产生大量推理成本。我们观察到,Transformer 中的不同层组表现出明显异质的速度动态:浅层高度稳定且易于进行积极的缓存,而深层则经历较大的速度变化,需要完整的计算。然而,现有的缓存方法将整个 Transformer 视为一个整体单元,每个时间步应用单个缓存决策,因此无法利用这种异构性。基于这一发现,我们提出了 LayerCache,这是一种层感知缓存框架,它将 Transformer 划分为层组,并在每个去噪步骤中做出独立的、每组的缓存决策。 LayerCache 引入了自适应 JVP 跨度 K 选择机制,该机制利用每组稳定性测量来平衡估计精度和计算节省。我们制定了一个关于时间步长、层组和 JVP 跨度的三维调度问题,并用贪婪预算分配算法来解决它。在 Qwen-Image(1024x1024,50 步)上,LayerCache 以 1.37 倍加速实现 PSNR 37.46 dB(比 MeanCache +5.38 dB)、SSIM 0.9834 和 LPIPS 0.0178(比 MeanCache 降低 70%),在质量-速度 Pareto 前沿上主导了所有先前的缓存方法。