论文
MaMe & MaRe:基于矩阵的词元合并和恢复,实现高效的视觉感知和合成
MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
摘要
词元压缩对于减轻 Vision Transformer (ViTs) 中自注意力机制的二次复杂度至关重要,该机制通常涉及大量输入词元。现有方法(例如 ToMe)依赖于 GPU 低效操作(例如排序、分散写入),从而引入了限制其有效性的开销。我们引入 MaMe,一种完全基于矩阵运算的 无需训练 可微标记合并方法,它对 GPU 友好,可加速 ViT。此外,我们还提出了 MaRe 的逆运算,用于词元恢复,形成用于图像合成的 MaMe+MaRe 管道。当应用于预训练模型时,MaMe 使 ViT-B 吞吐量增加了一倍,但精度下降了 2%。值得注意的是,微调 最后一层与 MaMe 一起以 1.1 倍的速度将 ViT-B 精度提高了 1.0%。在 SigLIP2-B@512 零样本分类中,MaMe 提供 1.3 倍的加速,性能下降可以忽略不计。在视频任务中,MaMe 在 Kinetics-400 上将 VideoMAE-L 加速了 48.5%,而准确率损失仅为 0.84%。此外,MaMe 在某些任务上实现了性能和速度的同时提高。在图像合成中,MaMe+MaRe 管道提高了质量,同时将 Stable Diffusion v2.1 生成延迟减少了 31%。总的来说,这些结果证明了 MaMe 和 MaRe 在加速视觉模型方面的有效性。代码可在 https://github.com/cominder/mame}{https://github.com/cominder/mame 获取。