论文

Qwen-Audio-3.0-Gen-Preview技术报告

Qwen-Audio-3.0-Gen-Preview Technical Report

应用与实践内容创作

摘要

现有的单域和多任务音频系统在直接将异构音频组件、氛围和多个角色组织成长形式的时间场景方面仍然受到限制。我们提出了 Qwen-Audio-3.0-Gen-Preview,这是一个统一的非自回归框架,它使用 Diffusion Transformer (DiT) 和共享变分自动编码器 (VAE) 来生成完整的混合波形。即时增强将自由格式的请求转换为结构化时间记录,并呈现为文本条件,而两阶段数据课程和语义条件视图训练所提出的模型在独立和混合场景音频中使用这些条件。共享的连续 VAE 将 48kHz 立体声波形压缩为 25Hz 潜在序列,并结合语义监督,为异构音频提供一种表示。在公共参考条件基准上,说话人相似性是所提出的模型在所有三个子集中最明显的优势。在多说话者和丰富的时间线基准测试中,其最明显的比较优势分别是两种语言和时间本地化的交叉一致性。在AudioCaps上,其优势集中在使用大型音频语言模型和AudioBox进行评估。这些结果证明了在没有特定于任务的分支的情况下统一生成时间结构化音频的潜力。