论文

VQ-Transplant:针对预训练视觉分词器的高效 VQ 模块集成

VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

模型训练参数高效训练

摘要

矢量量化 (VQ) 是现代离散视觉标记化的基础。然而,为最先进的基于 VQ 的模型训练量化模块需要大量的计算资源,这在实践中几乎阻碍了在资源限制下新颖、尖端的 VQ 技术的开发。为了解决这个限制,我们提出了 {\bf VQ-Transplant},这是一个简单的框架,通过替换原生 VQ 模块,可以将新的 VQ 模块即插即用地集成到冻结的、预先训练的分词器中。至关重要的是,所提出的移植过程保留了所有编码器-解码器参数,从而避免了在修改量化方法时进行昂贵的端到端重新训练的需要。为了减轻解码器量化不匹配的问题,我们引入了一种轻量级解码器适应策略(仅在 ImageNet-1k 上训练了 5 个 epoch),以使特征先验与新的量化空间保持一致。在我们的实证评估中,我们发现 VQ-Transplant 可以为 VAR 等行业级模型获得近乎最先进的重建保真度,同时将训练成本降低 95%。 VQ-Transplant 通过实现新型 VQ 技术的资源高效集成,同时匹配行业级重建性能,使量化研究民主化。