论文

有远见的高效训练:自回归图像生成的多词元辅助监督

Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

模型训练预训练

摘要

自回归 (AR) 图像生成通过将图像建模为离散标记序列,显示出了可扩展高保真合成的强大潜力。然而,传统的下一个词元预测(NTP)仍然受到稀疏和短视的监督、区分性表示不足以及由于对整个词元序列进行密集计算而导致的高训练成本的困扰。为了解决这些问题,我们提出了多词元自回归(MTAR),这是一种统一的训练框架,从预测目标、表示正则化和训练效率三个方面改进自回归图像生成。具体来说,MTAR引入了多词元预测(MTP),通过对多个未来词元进行联合监督,缓解传统NTP的稀疏性和短视性;采用 词元级 对比正则化(TCR)来显式增强采样标记表示的可分离性,从而提高表示的可辨别性;并将语义丢弃(SD)作为语义感知训练加速策略,以减少低信息标记上的冗余计算,同时保留信息丰富的学习信号。所有三个组件仅在训练期间应用,并且在自回归推理期间不会引入额外的开销。在ImageNet上,MTAR在生成质量和训练效率之间取得了更好的平衡。与 LlamaGen 相比,MTAR 的 FID 降低了 0.95,训练速度提高了 39%。此外,即使只有 1/3 的训练迭代,它仍然可以获得与基线相当或更好的性能,从而大大减少了训练时间。