论文

用于像素空间扩散的弹性词元压缩 Transformer

Elastic Token Compression for Pixel-Space Diffusion Transformers

模型推理推理加速

摘要

自然图像将其细节集中在帧的一小部分中,而扩散模型在每个图像块、每个层和每个时间步上都花费了完整的标记。像素空间模型的浪费最大,没有自动编码器首先吸收低级冗余。探测预训练的像素文本到图像 Transformer,我们发现无论图像是平坦的,它的中间块标记都是冗余的。冗余占据了连接的、内容形状的区域,并且利用它需要具有相同几何形状的词元。切割图像块的希尔伯特排序提供了它们。连续的位置始终是图像邻居,因此任何连续的运行都是一个连接区域,其大小和形状遵循内容,并且二维分组成为一维的切割。现有的削减都失去了其中的一部分。相似性合并会分散其组,潜在瓶颈会丢弃位置,而跳过会删除应总结的内容。我们切掉模型特征变化最大的地方,并将每次运行汇集到一个区域标记中。我们的区域词元接口(\method{})对这些词元采用扩散模型,在 微调 期间随机抽取区域计数,因此一个检查点服务于每个预算。 \method{} 在匹配的预算下领先于先前的缩减方法,以 $2.0\times$ 的速度匹配密集质量,并保持接近 $2.6\times$。代码和模型开源于 https://eduardzamfir.github.io/rti