论文

PHALAR:用于音乐音频表示学习的相量框架

PHALAR: Phasors for Learned Musical Audio Representations

模型训练预训练

摘要

音乐分轨检索需要把缺失分轨与给定音频混音匹配,现有方法因丢弃时间信息而受到限制。论文提出对比学习框架 PHALAR,相比现有领先方法,相对准确率最高约提升70%,参数量不足其50%,训练速度提高7倍。框架通过可学习频谱池化层和复值输出头,引入音高等变及相位等变归纳偏置。在 MoisesDB、Slakh 和 ChocoChorales 上,PHALAR 达到新的领先检索表现,与人类对音乐协调性的判断相关性显著高于语义基线。零样本节拍追踪与线性和弦探测进一步验证,框架捕捉了检索任务以外的稳健音乐结构。