论文
深度自适应高效视觉自回归建模
Depth Adaptive Efficient Visual Autoregressive Modeling
摘要
生成高分辨率图像时,视觉自回归 (VAR) 建模对每个位置应用固定的计算深度,效率低下。虽然现有方法通过使用频率图修剪标记来加速推理,但它们的二进制硬修剪方法从根本上受到限制,即使有更好的频率估计也无法提高质量。观察到 VAR 模型具有显着的深度冗余,我们提出了从修剪整个词元到自适应分配每个词元计算深度的范式转变。为此,我们引入了 DepthVAR,一个动态分配计算的 无需训练 框架。它集成了自适应深度调度程序,该调度程序通过循环旋转调度分配计算深度以实现平衡、非静态细化,以及动态推理过程,将这些深度转换为主要层掩码,有选择地应用 Transformer 块,并混合生成的代码以确保每个词元的影响与其处理深度成正比。大量实验表明,DepthVAR 在质量损失最小的情况下实现了 2.3$\times$-3.1$\times$ 加速,与现有的硬剪枝方法相比,提供了有竞争力的计算性能权衡。代码可在 https://github.com/STOVAGtz/DepthVAR 获取