论文

MOSAIK:图像词元的多补丁内容感知空间分配,以实现高效生成

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation

模型推理推理加速

摘要

像素空间扩散模型通过直接在图像空间中生成来避免潜在扩散模型的重建上限。然而,由于自注意力的二次复杂度,它们的词元数量大大增加,使得生成成本昂贵。几种现有的效率方法通过在选定的去噪步骤中使用更大的补丁来降低这种成本,从而用更少的标记来表示图像。然而,每个步骤仍然在整个图像上均匀地使用单个补丁大小,忽略了不同区域在粗化时会遭受不同的保真度损失。我们引入了 MOSAIK,这是一种损伤引导框架,可以跨区域改变补丁大小和去噪步骤。 MOSAIK 采用 PixelDiT 主干来生成任意异构补丁布局,轻量级预测器使用中间去噪特征来估计因粗化每个区域而导致的保真度损失。给定 词元预算,我们的损伤引导布局预测器将精细补丁分配给敏感区域,将粗糙补丁分配给其他地方。值得注意的是,MOSAIK 在将 FLOP 次数减少 70%、词元数量减少 83% 的同时,与 GenEval 上的全计算 PixelDiT 相匹配,并且其 DPG-Bench 分数仅下降了 1.0 分。与不同的效率范例(包括时间补丁调度和特征缓存)相比,我们的方法以适度的预算提供了极具竞争力的性能,并在高度受限的计算机制中始终优于这些基线。