驯服熵悬崖:用于自回归视觉生成的可变码本大小量化
Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation
摘要
大多数离散视觉分词器都依赖于默认设计:序列中的每个位置共享相同的代码本。研究人员尝试缩放码本大小 $K$ 以获得更好的重建性能。这种恒定码本设计达到了基本的信息论极限。我们观察到,训练集的每个位置的条件熵沿着序列衰减得如此之快,以至于在几个位置之后,条件分布基本上变得确定性。在 $K=16384$ 的 ImageNet 上,这种情况仅发生在 256 个位置中的 2 个位置中,从而将剩余的 254 个位置变成了记忆问题。我们将这种现象称为“熵悬崖”,并用一个简单的表达式将其形式化:$t^{*} = \lceil \log_2 N / \log_2 K \rceil$。有趣的是,这种现象在语言中没有观察到,因为其自然结构使每个位置的有效熵远低于密码本的容量。为了解决这个问题,我们提出了可变码本大小量化(VCQ),其中码本大小$K_t$沿着从$K_{\min}=2$到$K_{\max}$的序列单调增长,保持损失函数、参数计数和AR训练过程不变。通过普通的自回归 Transformer 和标准的下一个词元预测,VCQ 的基本版本将 ImageNet 上不带 CFG 的 gFID 从 27.98 降低到 14.80,比基线高出 256\times256$。按比例放大,它达到 gFID 1.71,具有 684M 自回归参数,无需任何额外的训练技术,例如语义正则化或因果对齐。 $K_{\min}=2$ 处的极端信息瓶颈自然会产生从粗到细的语义层次结构:仅对前 10 个标记进行线性探测,在 ImageNet 上即可达到 43.8% 的 top-1 准确率,而统一码本的准确率仅为 27.1%。最终,这些结果表明,重要的不仅是码本的总容量,还包括该容量的分配和组织方式。