论文

DeRA-MOS:通过解耦列表排序和模态对齐优化文本到音乐评估

DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

模型评测评测方法与指标

摘要

评估文本到音乐 (TTM) 系统仍然很昂贵,因为音乐印象 (MI) 和文本对齐 (TA) 分数依赖于人类平均意见分数 (MOS)。大多数自动 MOS 估计器都经过逐点回归或分布分类的训练。这些目标不直接优化基于排名的指标,并且为跨模式一致性提供弱几何约束。为了解决这些差距,我们提出了 DeRA-MOS,一种用于 TTM 评估的解耦优化框架。对于 MI,我们引入了批量感知列表排名损失,它对每个小批量内的相对顺序进行建模,并更好地与基于 Spearman 排名相关系数 (SRCC) 的评估保持一致。对于 TA,我们引入了一种分数锚定的模态对齐损失,它将人类分数映射到目标音频文本相似性,并在融合之前规范潜在空间。通过有效缓解逐点训练不匹配和模态漂移,MusicEval 上的实验表明,我们的解耦框架在 MI 和 TA 排名指标方面都取得了实质性改进,为大规模 TTM 评估建立了强大的范例。