论文

KVAE:多模态生成模型的分词器系列

KVAE: Family of Tokenizers for Multimodal Generative Models

应用与实践内容创作

摘要

潜在扩散建模 (LDM) 是一种重要的范例,它利用分词器将输入信号映射到压缩表示。这种依赖性将分词器定位为生成过程本身的一个组成部分,因为它影响学习速度、合成样本的质量并为以后的应用奠定基础。本报告介绍了一系列用于音频、图像和视频的 KVAE 分词器,所有这些都是为后续文本条件生成而设计的:KVAE-Audio,一种连续全频带 48 kHz 分词器,具有 50 Hz 潜在的 64 个通道; KVAE-3D——两个用于 4x16x16 和 4x8x8 压缩的因果视频分词器; KVAE-2D,一种图像模型,将输入压缩 8 倍,具有 32 个通道。我们证明了客观(Frechet Distance、CLIP 分数、CLAP 分数等)和主观(并行评估)指标的重建(PSNR、LPIPS、PESQ 等)和生成结果匹配或超越了前沿开源分词器,例如来自 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio 和 MMAudio 的 VAE。考虑到开发难度,我们与社区分享训练细节、模型选择方法以及设计选择的消融。该代码可在 https://github.com/kandinskylab/kvae 和 https://github.com/kandinskylab/kvae-audio 上公开获取。