论文

通过人类偏好奖励改进文本到音乐的生成

Improving Text-to-Music Generation with Human Preference Rewards

模型训练偏好优化

摘要

我们描述了我们在 ICME 2026 上进入学术文本到音乐 (ATTM) 大挑战的效率轨道。除了挑战协议的 FAD-CLAP 和 CLAP 分数之外,我们还添加了来自 TuneJury 的学习人类偏好奖励,TuneJury 是一个在开放音乐偏好数据集上训练的成对排序器。奖励既充当训练时间调节信号又充当样本选择标准。该管道结合了 120M 参数 FluxAudio-S 主干上的五个工程决策,其中四个在训练时,一个在推理时:(i) 训练时奖励调节,兼作推理时间 CFG 轴,(ii) 扫描五种得分调节架构,其中训练和推理使用不同的变体,(iii) 顶部十分位的专家迭代,(iv) 用于音频文本对齐的简短偏好调整通道 (CRPO),以及(v) 通过联合 CFG、源分离和响度归一化进行推理后处理。对 100 首歌曲描述器提示的每阶段分解显示,训练时间奖励调节作为功能调节轴,专家迭代作为主要贡献者,偏好调整通道仅添加噪声级增益,并且推理时间分数标量在链末端已经饱和。