论文

MergeTok:通过词元合并统一连续和离散视觉词元化

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

模型架构新型架构

摘要

大多数用于图像生成的视觉分词器分为两个系列,具有互补的局限性:连续 VAE 提供高保真重建,但存在密集、纠缠的潜在特征,不太适合语义控制,而基于 VQ 的离散模型支持自回归生成,但与梯度稀疏、不稳定训练和码本崩溃作斗争。在这项工作中,我们引入了 MergeTok,这是一种统一的分词器,它利用标记合并技术作为语义桥梁,在编码器-解码器架构中联合优化连续 (VAE) 和离散 (VQ) 分词器。通过在编码过程中对相似的词元进行聚类,MergeTok 建立了一个提供双重监督信号的结构先验:(i)它在 VAE 分支中强加合并词元语义对齐,将其潜在空间规范化为解开的、语义感知的表示; (ii) 它导出分组约束,促进组内多样性和组间排他性,从而稳定 VQ 训练。 MergeTok 在 ImageNet-256 上表现出有竞争力的重建和生成性能,在匹配的 词元预算 下,其 rFID 明显低于强大的 VAE 和 VQ 模型,同时生成与自回归和扩散生成器兼容的语义组织的标记表示。这表明单一架构可以赋予视觉分词器强大的语义组织和生成器友好的离散性。