论文

TrueMuse:文本到音乐模型中数据归因的基准

TrueMuse: A Benchmark for Data Attribution in Text-to-Music Models

模型评测基准与评测资源

摘要

文本到音乐生成模型是在大量音乐收藏上进行训练的,这对可以量化单个训练样本贡献的数据归因方法的需求不断增长。然而,由于缺乏可靠的基础事实,现有的归因方法很难严格评估,这使得可靠地评估其实际效果具有挑战性。为了解决这一差距,我们引入了 TrueMuse,这是一个受控数据集和文本到音乐数据归因的基准。 TrueMuse 是通过在精心策划的归因样本上微调三个基于扩散的文本到音乐模型而构建的,已知的微调包含提供了用于评估的受控归因目标。该基准涵盖四种属性设置,涵盖旋律结构、音色特征、艺术家级风格签名和流派级共享模式,并包括 133 个属性、648 个微调模型和跨两种提示类型的 95,456 个生成样本。使用TrueMuse,我们从微调改进、提示类型难度、多任务训练和微调数据大小四个维度系统地评估现有的黑盒归因方法。我们的结果表明,归因仍然具有挑战性,现有方法在不同的评估设置中表现出很大的差异,这凸显了文本到音乐生成需要更可靠和更通用的归因方法。代码和数据集将在接受后发布。