论文

Qwen-Music技术报告

Qwen-Music Technical Report

应用与实践内容创作

摘要

我们介绍Qwen-Music,一种音乐生成模型,可以生成具有完整人声的高保真歌曲。它支持从描述、歌词和音乐属性生成文本到音乐,并支持不同风格和人声特征的翻唱生成。 Qwen-Music 包含三个组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。标记器将音频压缩为音乐语义词元的 25 Hz 单码本流,保留语义和旋律信息。 LLM 使用基于旋律词元的思​​想链 (Melody-CoT) 机制执行自回归建模,该机制在生成整首歌曲之前规划旋律,从而提高音乐性、结构连贯性和参考旋律保存。渲染器用声学细节丰富离散语义标记,以产生高保真立体声波形。我们使用质量意识 预训练 课程来训练 LLM,然后使用渐进式 后训练 进行监督初始化、离线 DPO 和在线 GSPO,以提高音乐性和指令遵循性。在 600 项评估输入中,Qwen-Music 在 16 项客观音乐性和音频质量指标中的 13 项中取得了最先进的结果。专业评估人员也更喜欢 Qwen-Music,而不是领先的专有系统。对于翻唱生成,Qwen-Music 在 AI 生成的参考集上比 Suno V5.5、Suno V5 和 MiniMax Cover 更准确地保留参考旋律,并且在现实世界流行歌曲参考集的大多数指标上优于 MiniMax Cover。