论文
通过可学习的全局合并进行可变长度标记化以进行扩散 Transformer
Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers
摘要
潜在扩散模型 (LDM) 已在视觉合成中占据主导地位,但其质量计算权衡在很大程度上受到分词器固定压缩比的限制。可变长度标记器 (VLT) 通过改变标记计数来实现自适应压缩,从而允许扩散模型灵活地平衡质量和计算。然而,传统的 VLT 通过截断有序词元序列来调整长度,这使得词元语义依赖于词元位置并破坏了跨长度的表示对齐。这会导致潜在分布的横向长度偏移,从而阻碍单个可变长度扩散模型的有效运行。为了解决这个问题,我们提出了一种新颖的可变长度标记器,它通过合并标记来调整长度。我们表明,当扩散 Transformer 根据合并模式运行时,鼓励相似的标记合并可以实现直接的跨长度表示对齐。由于传统的合并方法是数据相关的,使得在生成过程中无法访问合并模式,因此我们引入了与数据无关的可学习全局合并,以确保与扩散 Transformer 的兼容性。在 ImageNet 256$\times$256 一代中,我们基于合并的可变长度分词器与扩散 Transformer 集成,与之前的 VLT 方法相比,实现了卓越的 gFID 计算权衡。代码可在 [此 https URL](https://github.com/movinghoon/lgm) 获取