论文
logits Refiner:通过尺度内依赖性建模改进视觉自回归模型
Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling
摘要
视觉自回归模型 (VAR) 通过下一尺度预测生成图像,并行生成每个尺度内的所有标记。我们表明,这种并行解码构成了一种平均场式近似,它丢弃了相同尺度标记之间的空间依赖性,从而导致局部不相干的样本,而不管主干容量如何——这是解码规则的限制。为了解决这个限制,我们引入了 logits Refiner,这是一个轻量级自回归模块,它通过以冻结主干特征为条件的顺序采样词元来恢复尺度内依赖性。仅添加约 10% 的参数和不到 5% 的基本模型训练计算,它可以插入任何预训练的 VAR 检查点,无需重新训练。受控消融将联合内部规模采样(而不是额外的能力或训练)作为关键要素。在类条件 ImageNet 256x256 上,从 310M 到 2B 参数的主干网中,精炼器不断提高生成质量,使 1.1B 参数模型的大小超过其两倍。该方法进一步推广到文本到图像的生成,证实平均场瓶颈在 VAR 变体中持续存在,并且通过我们的方法有效缓解。项目页面:https://compvis.github.io/logits-refiner/