论文
面向文本到音乐生成的量规优化
Rubric-Based Optimization for Text-to-Music Generation
摘要
文本到音乐生成的后训练需要捕捉音乐质量多方面、超出任何单一自动指标的奖励信号。我们研究来自预训练音频语言模型(ALM)的结构化、量规式奖励,作为自回归与扩散音乐生成器的训练信号:ALM对照量规为每个生成片段打分;我们把为同一提示生成的候选按分数排序并转为偏好对,用于MusicGen-small与ACE-Step v1的DPO,另外把量规分直接作为标量奖励用于ACE-Step v1的DiffusionNFT。MusicCaps上量规优化同时改善CLAP、SongEval与Audiobox-Aesthetics,最强增益来自ACE-Step上的DiffusionNFT。相比之下MusicGen-small上,从任一自动评估器构建偏好都会产生清晰的跨指标权衡——目标评估器改善而其他独立评估器退化。我们进一步研究有精确客观奖励的节奏、调性与配器:直接优化这些专门奖励可靠改善目标属性,而ALM量规对节奏与配器仅有部分迁移、对调性无可测改善。结果提示实际的分工:ALM量规对难以形式化的广泛感知品质有效,而当可靠测量可用时专门客观奖励仍更可取。