论文

层级 token 扩散

Level-of-Token Diffusion

模型推理推理加速

摘要

图像和视频扩散模型为每个区域分配相同的计算量,即使预期场景需要不同的细节级别。通常可以在生成之前预测细节的空间分布,从而表明可以减少计算的地方。我们引入了 Level-of-Token (LoT) Diffusion,这是一个框架,可将这些知识转化为显式多分辨率 token 布局(Level-of-Token 布局),以实现自适应且高效的生成。 token 表示不同大小和形状的矩形块,在需要细节的地方分配更精细的 token,在其他地方分配更粗糙的 token。我们通过逐图块不对称流参数化和多分辨率 token 的嵌入,将预训练的扩散 Transformer适应 LoT 布局,在每个去噪步骤中保留全分辨率流预测,同时仅处理简化的 token 序列。 LoT Diffusion 可实现布局自适应生成,同时保留预先训练的生成先验。我们使用源自语义掩模、边界框、纹理方差和景深线索的布局以及 Agentic 计划来演示 LoT。在图像和视频生成过程中,LoT 提供了良好的质量效率权衡,显着的加速取决于布局的 token 预算。我们的项目网站是https://georgenakayama.github.io/lotdiffusion/.

层级 token 扩散的原论文方法或结果图
图 1:token 级别 (LoT) 扩散使用空间 token 布局来分配计算,该布局指定空间变化的细节级别,以实现高效的图像和视频生成。 token 布局源自不同的空间先验,通过与 token 预算相关的加速来指导细节分配。