论文
在哪里优化,何时停止:通过潜在差异重新思考冗余,以实现高效的视觉自回归生成
Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation
摘要
视觉自回归 (VAR) 模型可生成高质量的图像,但在高分辨率下会出现显着的推理延迟。最近的加速方法最依赖于具有层特征的启发式措施来修剪词元。这种启发式方法对复杂的上下文语义很敏感,导致冗余计算的识别不准确以及跨提示的适应性差。我们从 VAR 中的冗余对像素空间生成的影响的角度重新考虑冗余,并引入潜在差异。这个统一的指标通过测量生成过程中模型状态的变化来量化词元的贡献。我们的分析表明,当由图像潜在或像素空间信号引导时,可以更准确地识别冗余。我们进一步观察到,在无分类器指导(CFG)中,条件分支和无条件分支之间的差异的收敛趋势在不同的提示下表现出高动态性。基于这些发现,我们提出了 LD-Pruning(潜在差异剪枝),这是一种 无需训练 框架,通过集成免解码区域选择和自适应无条件分支跳跃,通过潜在差异消除冗余。大量实验表明,LD-Pruning 显着减少了推理延迟,同时保持了较高的生成质量,在 Infinity-8B 上实现了高达 2.35 倍的加速。