论文
等变音乐 Transformer
Equivariant Music Transformer
摘要
即使音乐段落在时间上发生了变化或音调上发生了变化,人类也能识别出它,这表明了表示空间中的等变性概念。然而,我们的分析表明,标准音乐 Transformer 将这种时移或音调转换的输入映射到不相关的表示上:这些模型随着规模的扩大或训练时间的延长而变得越来越不等变。这表明在标准音乐 Transformer 中,额外的模型容量被分配用于记忆绝对模式而不是捕获共享的音乐结构。在本文中,我们提出了等变音乐 Transformer (EMT),它通过联合优化下一个词元预测和辅助等方差正则化损失,通过自 蒸馏 强制等方差。我们发现额外的等方差损失充当有益的正则化器,同时改进下一个标记预测并产生等变潜在表示。通过客观和主观评估,与数据增强、特征工程和最先进的 (SOTA) 基线相比,EMT 表现出了卓越的等方差性和生成能力。更广泛地说,我们的研究结果表明,仅标准语言建模方法并不能捕获音乐的平移对称性,并且需要专门的归纳偏差来产生更好的音乐表示。代码、权重和演示可在线获取。