论文
具有辅助调节分支的器乐文本到音乐生成
Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches
摘要
文本到音乐的生成技术发展迅速,现代自回归和基于扩散的模型可以根据自然语言提示生成令人信服的音乐。然而,这些进展在很大程度上依赖于大规模训练数据和外部预训练,因此很难在数据和预训练受到控制时隔离哪些设计选择仍然有效。我们使用带有歌词和音色调节的 Diffusion Transformer 主干来研究此设置,该主干适用于仅乐器文本到音乐的任务,其中辅助歌词和音色分支仅接收简并调节信号。通过受控的消融,我们发现在没有这些分支的情况下重新训练的模型在 AudioBox 美学、LLM 作为法官和人类 MOS 方面得分较低,并且将保存的参数重新投入作为额外的 DiT 深度只能略微恢复。这表明辅助分支可能充当训练时的架构锚,其贡献超出了其明确的调节内容。我们通过与外部乐器基线的比较以及向 ICME 2026 学术文本转音乐 (ATTM) 大赛提交的作品来验证同一模型,其中我们提交的表现在客观指标和随后组织者管理的 MOS 超过 35 名评分者中均排名第一,在所有挑战提交中获得最高的总体 MOS,而我们的效率提交入围决赛,在客观指标下并列第二。