论文

Qwen-Image-VAE-2.0技术报告

Qwen-Image-VAE-2.0 Technical Report

应用与实践内容创作

摘要

我们推出了 Qwen-Image-VAE-2.0,这是一套高压缩变分自动编码器 (VAE),它在重建保真度和扩散性方面取得了显着进步。为了解决高压缩的重建瓶颈,我们采用了一种改进的架构,具有全局跳过连接(GSC)和扩展的潜在通道。此外,我们将训练规模扩大到数十亿张图像,并采用合成渲染引擎来提高文本丰富场景中的性能。为了解决高维潜在空间的收敛挑战,我们实施了增强的语义对齐策​​略,使潜在空间非常适合扩散建模。为了优化计算效率,我们利用非对称且无注意力的编码器-解码器主干来最大限度地减少编码开销。我们在公共重建基准上对 Qwen-Image-VAE-2.0 进行了综合评估。为了评估文本丰富的场景中的性能,我们提出了 OmniDoc-TokenBench,这是一个新的基准,包含各种真实文档集合以及专门的基于 OCR 的评估指标。 Qwen-Image-VAE-2.0 实现了最先进的重建性能,在高压缩比下在通用领域和文本丰富的场景中展示了卓越的能力。此外,下游 DiT 实验表明我们的模型具有卓越的扩散性,与现有的高压缩基线相比,显着加速了收敛速度。这些使 Qwen-Image-VAE-2.0 成为具有高压缩、卓越重建和卓越扩散性的领先模型。