论文

以音频文本对齐评分提高有限数据下的音乐生成训练效率

Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation

模型训练预训练

摘要

先进文本到音乐系统依赖大型专有数据集与工业级算力,难以区分架构贡献与资源优势。研究提出评分感知训练,将音频与文本描述的对齐评分作为整个流程的直接监督信号。方法不简单丢弃低分片段,而用CLAP条件的Beta噪声时间步调度将其分配到高噪声训练条件,形成隐式正则化;片段级过滤剔除最不匹配的样本,两阶段文本描述流程缓解详细训练描述与简短推理提示的分布差异。REPA辅助损失从预训练CLAP与MuQ编码器迁移结构化语义知识,无需额外数据。基于FluxAudio的450M参数系统参加ICME 2026 ATTM挑战效率赛道,在两个赛道的客观评测中均排名第二,最终MOS评测在效率赛道排名第三。