论文
BeCARE:用于扩散 Transformer 加速的预算缓存刷新
BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration
摘要
无需训练 特征缓存通过重用或预测中间特征来加速扩散 Transformer (DiT) 推理。然而,固定的时间表使计算可预测,但忽略了与提示和时间步相关的风险,而手动调整的错误阈值在本地进行调整,但使实现的计算难以控制。为了解决这些限制,我们提出了预算缓存刷新 (BeCARE),这是一个 无需训练 框架,在给定用户指定的完整计算上限的情况下,自适应地确定加速推理期间刷新缓存的时间。具体来说,我们首先从采样器的噪声表中得出误差放大曲线,以表征去噪时间步长中近似误差的不同影响。然后,我们将此配置文件与特定于提示的外推残差和缓存年龄结合起来,形成累积的风险评分,当持续缓存变得有害时触发刷新。同时,我们使用相同的配置文件来构建分析支出参考,并通过反馈调整刷新阈值,从而将有限的刷新预算分配到采样轨迹上。最后,结构性保障措施(固定预热、预算衍生的后期储备和最大缓存重用长度)可防止不可靠的外推和过早的预算耗尽。这些设计支持即时自适应刷新放置,并允许单个校准跨预算层传输,而无需逐层调整。在 FLUX.1-dev 上进行的具有 200 个提示和测量的 FLOP 的实验表明,我们的方法在加速从 3 倍到 6 倍的范围内始终优于代表性的 无需训练 缓存基线。在主要工作点(3.3 倍加速),它在不使用更多计算的情况下将配对 PSNR 比最强基线提高了 2.7 dB。在 SD3.5 Large 上,它还通过匹配计算的固定间隔调度显着改进了相同的 Taylor 缓存引擎。