论文

StableVQ:稳定矢量量化分词器训练的实用指南

StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training

模型训练预训练

摘要

矢量量化 (VQ) 是离散视觉分词器的基础,为现代自回归和掩模图像生成模型提供支持。虽然最近的共享投影码本方法大大提高了码本利用率,但训练稳定性仍然是一个关键且尚未充分探索的挑战。我们认为,根本原因在于编码器-解码器和密码本训练的纠缠:因为两个模块都无法单独可靠地履行自己的职责,系统只有在两个子系统碰巧合作时才能发挥作用——这种脆弱的情况恰恰在训练压力最大时崩溃。我们提出了 StableVQ,它重新审视每个模块的正确学习目标,并解决每个模块被训练以独立履行自己的角色时出现的问题。具体来说,(1)动态STE纠正了编码器学习目标的不稳定性,使其能够在离散正则化下稳健地优化重建空间,即使码书利用率较低。 (2)Region VQ Loss重新构思了Codebook的学习目标,使其能够独立保证对编码器输出分布的完全跟踪,而不依赖于编码器振荡来驱动激活。 (3)解耦调度认识到编码器-解码器和码本的不同职责需要不同的优化动态,并为每个分配一个独立的学习率调度以确保稳健的系统级行为。 StableVQ 建立在共享投影码本之上,是轻量级的,并且不引入可学习的参数。 ImageNet 上的实验表明,在不同的码本大小和初始化设置下,训练稳定性、码本利用率和重建质量得到了持续改进。