论文
HiLo-Token:输入自适应高低频词元压缩,实现高效图像编辑
HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing
摘要
创意图像编辑工具(例如 Photoshop 的“删除”或“生成填充”按钮)是客户日常使用的核心,并且在 Photoshop 和 Lightroom 中占据了主要流量份额。然而,当前的生成式 AI 模型面临着巨大的延迟挑战,当从基于卷积的 U-Net 过渡到 Diffusion Transformer (DiT) 时,这一问题变得更加明显。在我们对跨越各种掩模比的数百个代表性图像编辑样本的评估中,即使在从 50 个时间步长缩减到 8 个时间步长之后,DiT 模块本身就平均占总模型延迟的 73%。为了应对这一挑战,我们提出了 $\textbf{HiLo-Token}$,一种输入自适应词元压缩框架,它将更多的 词元预算 分配给高频、丰富上下文区域,同时将更少的词元分配给低频区域。具体来说,对于用户掩码指定的编辑区域,我们将所有标记保留在扩展掩码内,以保留强大的局部性和上下文相关性。在编辑区域之外,我们引入了一种基于空间频率的简单而有效的高频标记选择策略,以捕获重要的局部细节,同时使用 16 倍下采样图像中的标记来表示低频分量并保留模糊但全局的结构。对生产级评估数据的大量实验验证了该方法的有效性,在 A100-80GB 上,针对小、中、大掩模比率类别的图像编辑任务,实现了 3.13 倍、2.59 倍和 1.67 倍的 DiT 加速,平均比率分别为 6.38%、15.92% 和 35.36%,且生成质量没有任何回归。