论文
视觉隐式自回归建模
Visual Implicit Autoregressive Modeling
摘要
基于下一尺度预测的视觉自回归建模(VAR)实现了强大的生成质量,但其显式深度堆栈固定了每个尺度的计算量并在高分辨率下增加了内存。我们引入了视觉隐式自回归建模(VIAR),这是一种下一代自回归生成器,它在浅前/后块之间嵌入了隐式平衡层。隐式层使用雅可比自由反向传播进行训练,产生恒定的训练内存,而推理则公开了支持计算控制的每尺度迭代旋钮。在 ImageNet 256x256 基准上,VIAR 仅用 38.4% 的 VAR 参数就达到了 FID 2.16 和 sFID 8.07,匹配或超越了强大的 AR 基线,并与大型扩散模型保持了竞争力。通过控制每个尺度的旋钮,VIAR 可以将峰值内存从 19.24 GB 减少到 8.53 GB,并将单个 RTX 4090 上的吞吐量从 15.16 图像/秒增加到 32.08 图像/秒,而无需重新训练。消融表明,更少的步骤足以使定点迭代收敛,并且 VIAR 在质量效率操作点上始终主导 VAR。在零镜头修复和类条件编辑中,VIAR 可以生成更清晰的细节和更平滑的边界,同时保留全局结构,验证隐式平衡和按比例计算控制对于实用、可部署的视觉生成的优势。