论文
通道方式矢量量化
Channel-wise Vector Quantization
摘要
我们提出了通道式矢量量化(CVQ),这是一种新颖的图像标记化范例,用通道式标记取代了补丁式标记。与传统的向量量化不同,传统的向量量化为每个块特征向量分配一个离散的标记,CVQ 量化特征图的每个通道。该公式将图像表示为离散级别的视觉细节,而不是空间块的网格。基于CVQ,我们引入了一种新的具有“下一通道预测”的视觉自回归框架。我们的通道自回归 (CAR) 模型不是按光栅顺序逐块渲染图像,而是按顺序预测图像通道,从而产生逐渐丰富的视觉细节。具体来说,它首先绘制全局结构,然后细化细粒度属性,类似于人类艺术家的工作流程。根据经验,我们表明:(1)CVQ 在 16K+ 码本大小的情况下实现了 100% 的码本利用率,并且没有任何附加功能,并且比传统 VQ 显着提高了重建质量; (2) CAR 的 DPG 得分为 86.7,GenEval 得分为 0.79,证明了文本到图像生成的强大有效性。