论文
Qwen-Audio-VAE技术报告
Qwen-Audio-VAE Technical Report
摘要
我们引入了 \textbf{Qwen-Audio-VAE},这是一套低比特率、快速编码的连续音频自动编码器,专为可扩展的通用音频生成而设计。该模型围绕一个简单但重要的原则构建:音频 VAE 不仅应该以高保真度重建不同的音频,而且还应该足够快地生成紧凑的潜在表示,以支持大规模文本到音频的训练。 Qwen-Audio-VAE 结合了因果编码器-解码器、窗口 Transformer 块和多鉴别器训练,以实现重建质量和压缩率之间的强大平衡。该模型经过 500 万小时多域音频的大规模训练,能够在异构声学条件下进行稳健的重建。为了进一步提高计算效率,我们采用非对称编码器-解码器主干,并引入延迟感知编码器修剪以最大化编码吞吐量。对公共语音、音乐和声音重建基准的实验表明,Qwen-Audio-VAE 在不同的音频领域具有良好的泛化能力,并且特别高效,仅需要 541 毫秒即可编码 32 分钟的音频。总体而言,Qwen-Audio-VAE 为高效的通用音频生成提供了高质量、紧凑且高吞吐量的表示骨干。