论文
StepAudio 3 音乐技术报告
StepAudio 3 Music Technical Report
摘要
我们推出了 StepAudio 3 Music,这是一种大规模、长格式的音乐生成模型,支持明确的音乐规划和开放域文本控制生成。 StepAudio Music Tokenizer 将音频表示为来自 65536 个条目的单码本的 50 Hz 流,使用语义信息自监督和多任务训练来保留音乐结构和重建相关信息。流匹配扩散Transformer (DiT) 预测连续的 StepAudio VAE 潜在信号,我们的 VAE 解码器将其转换为 48-kHz 音频。这种离散连续设计以单码本 VQ、语义和声学 RVQ 以及不同 DiT 配置的比较为指导。对于明确的规划,专家混合自回归模型使用 ABC 表示法在预测音乐标记之前生成中间安排计划 (ABC-CoT),使和声、节奏和旋律结构成为生成上下文的一部分。渐进式训练课程和监督微调支持歌曲和乐器生成、干声伴奏生成以及长达 5 分 30 秒的翻唱歌曲合成。通过直接偏好优化 (DPO) 进行强化学习,最终模型在评估的系统中获得了最高的 AudioBox 内容享受度、内容实用性和制作质量得分以及最高的 MuQ-MuLan 相似度,并具有具有竞争力的 SongBench 结果。在初步的Artificial Analysis Music Arena Vocals排行榜上,它获得了1105的Quality Elo,仅落后于Suno V5.5和Mureka,领先于Suno V5、MiniMax型号和其他系统。音频演示位于 https://stepaudiollm.github.io/step-audio-3-music。