论文
MusicRLVR:用分级可验证奖励训练满足多重约束的音乐生成
Which Constraints Are Missing? Ask the Verifier: Graded Rewards for Constraint-Following Music Generation
摘要
遵循约束的音乐生成要求一份乐谱同时满足多项用户指定属性,例如调性、拍号、长度、音域、终止音、节奏、旋律运动和曲式,各项均可用程序检查,但尚无基准单独测量这一能力。本文构建MusicConstraintBench,包含八类约束、2180个样本,现有模型在组合少量约束后就明显失效。自然的改进方法是用验证器提供强化学习奖励,但只有全部属性满足时才奖励,会使多数训练组缺少学习信号:前50次更新中,55.0%的采样组分数完全相同、没有梯度,而失败乐谱通常只缺少一项要求。同一提示下的采样结果往往共同失败,二元奖励无法区分接近正确的乐谱与格式错误的乐谱。作者因此提出MusicRLVR:先以严格验证关卡排除格式错误输出,再按各项属性满足程度分别奖励,并增加全部满足的奖励,无需人工标注、学习奖励模型或音乐领域微调。在混合约束任务上,MusicRLVR把Qwen3-4B-Instruct的表现从0.160提高至0.807,高于所有零样本基线,包括得分0.380的Llama-3.1-70B。方法还泛化到训练未见过的属性组合和超出训练范围的参数值,说明可验证奖励不必预设唯一目标输出。