论文
通过输出相似性意识重新思考扩散模型的标记减少
Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness
摘要
Diffusion Transformer (DiTs) 实现了卓越的图像生成质量,但受到相对于词元计数的二次计算复杂性的影响。虽然已经提出了各种词元减少(TR)方法来减轻这种成本,但它们忽略了生成模型的主要目标:最小化恢复误差,这需要反映输出词元的相似性。它们仅依赖于从仅简化 ViT 范式继承的输入词元相似性,导致与此目标根本不一致。为了弥补这一差距,我们提出了 DiTo,一种新颖的 TR 范式,它将重点转向以输出为中心的词元减少。基于对相邻时间步长中输出标记相似性得到一致保留的观察,DiTo 利用先前步骤的相似性作为有效代理,在匹配时间步长处建立标记对应关系,然后在多个后续的缩减时间步长中重复使用这些对应关系。为了优化这种交错调度,我们提出了配对匹配比(PMR)引导的间隔调度来确定最佳匹配频率。此外,为了减轻局部近似误差和重复使用造成的块效应,我们提出通过结合选择频率惩罚来进行频率感知词元匹配。大量实验表明,DiTo 始终优于现有 TR 方法,在相当的加速下 PSNR 高出 1.6-3.9 dB,实现了卓越的 Pareto 前沿。