论文
TC-AE:解锁深度压缩自动编码器的词元容量
TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders
摘要
我们提出了 TC-AE,一种基于 ViT 的深度压缩自动编码器架构。现有方法通常增加潜在表示的通道数量,以在高压缩比下保持重建质量。然而,这种策略通常会导致潜在的表示崩溃,从而降低生成性能。 TC-AE 没有依赖日益复杂的架构或多阶段训练方案,而是从词元空间(像素和图像潜在之间的关键桥梁)的角度通过两个互补的创新来解决这一挑战:首先,我们通过在固定潜在预算下调整 ViT 中的补丁大小来研究词元数量缩放,并将激进的词元到潜在压缩确定为限制有效缩放的关键因素。为了解决这个问题,我们将词元到潜在的压缩分解为两个阶段,减少结构信息丢失并实现有效的词元数量缩放。其次,为了进一步减轻潜在表示崩溃,我们通过联合自监督训练增强图像标记的语义结构,从而产生更易于生成的潜在特征。通过这些设计,TC-AE 在深度压缩下实现了显着改善的重建和生成性能。我们希望我们的研究能够推进基于 ViT 的视觉生成标记器。