论文

FlashAR:用于自回归图像生成的高效 后训练 加速

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

模型推理推理加速

摘要

大规模自回归模型在图像生成方面表现出了卓越的能力。然而,它们的顺序光栅扫描解码严格依赖于下一个词元预测,使得推理成本过高。现有的加速方法通常要么引入全新的生成范式,这需要从头开始昂贵的 预训练,要么以训练推理差距或改变预测目标为代价实现并行生成。在本文中,我们介绍了 FlashAR,这是一种轻量级的 后训练 适应框架,可有效地将预训练的光栅扫描自回归模型调整为基于双向下一个词元预测的高度并行生成器。我们的主要见解是,有效的适应应该最大限度地减少对预训练模型原始训练目标的修改,以保留其学到的先验知识。因此,我们保留原始 AR 头作为水平头进行行式预测,并引入一个互补的轻量级垂直头进行列式预测。为了促进有效的适应,我们将垂直头从中间层而不是最终层分支,绕过了固有的水平头偏差。此外,由于水平和垂直预测捕获了互补的依赖关系,其相对重要性随着目标位置的不同而变化,因此我们采用可学习的融合门来动态组合每个位置的两个预测。为了进一步降低适应成本,我们提出了一个两阶段的适应管道:首先通过预训练的自回归模型的适应来初始化垂直头,然后与骨干网联合微调以适应新的解码范式。在 LlamaGen 和 Emu3.5 上的大量实验表明,FlashAR 通过轻量级 后训练 仅用原始训练数据的 0.05%,即可将 512x512 图像生成速度提高 22.9 倍。