论文

向前聆听:下一个补丁嵌入预测可实现可扩展的音频学习器

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

模型训练预训练

摘要

尽管现有方法越来越依赖精心设计的 预训练 配方来达到有竞争力的性能,但自监督学习 (SSL) 推动了音频表示学习的重大进展。一种明显不同的 预训练 哲学支撑着语言建模以及最近的视觉表示学习中最有影响力的进展:不是将编码器训练为静态特征提取器,而是训练模型根据先前的上下文预测下一个元素、离散标记或连续嵌入。因此,自回归预测提供了一个统一的 预训练 接口,可以跨模态传输,迫使模型学习底层数据分布。我们询问这样一个简单的因果范式是否可以产生强大的音频学习器,因为音频的时间结构使得补丁嵌入的自回归预测成为自然的选择。我们引入了 NAPE(下一个音频补丁嵌入预测),这是一个自监督框架,其中因果 Transformer 使用因果掩蔽和停止梯度作为其唯一的训练信号,预测前一个 log-mel 频谱图的每个下一个补丁嵌入。该设计有意简约,避免了重建解码器、声学分词器、学生-教师设置和辅助正则化损失。在六个音频和语音基准测试中,NAPE 在多项任务上实现了最先进的 微调 性能,在编码器尺寸上一致扩展,并产生强大的线性探测结果。 NAPE 还可以在没有明确监督的情况下产生结构化的注意力模式。