论文

AViTS:用于高效动态分辨率生成的自适应时空标记选择

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

模型推理推理加速

摘要

Diffusion Transformer (DiTs) 实现了高质量生成,但由于迭代采样而成本高昂。动态分辨率采样通过低分辨率去噪降低了早期成本;然而,在分辨率转换时对所有潜在标记进行统一上采样会导致冗余计算,并可能降低精细细节的一致性。现有的部分上采样策略通常依赖于局部潜在结构线索或单步统计,这使得很难在扩散步骤中联合捕获词元文本语义相关性和词元明智的表示动态。我们提出了 AViTS,一种用于动态分辨率 DiT 的自适应时空标记选择框架。 AViTS 通过潜在文本注意力对空间重要性进行建模,通过 词元级 跨扩散时间步长的特征变化对时间重要性进行建模,并将它们融合以实现时空重要性感知的选择性上采样:它优先考虑关键标记的分辨率细化,同时推迟不太重要的标记,从而减少冗余的高分辨率计算并提高质量效率权衡。 AViTS 在 FLUX 上实现了高达 6.34 倍的性能提升,在 Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上实现了近 9 倍的 FLOP 减少,正交于 蒸馏、量化和特征缓存,并通过蒸馏模型达到了 14.76 倍。代码:https://github.com/QHR69/AViTS