论文

ULTRAS——音频和语音信号 Transformer 表示的统一学习

ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals

模型训练预训练

摘要

自监督学习 (SSL) 通过采用时域预测目标,推动了语音处理领域取得了令人瞩目的进步,而音频表示学习框架则在时频频谱图上运行。针对一种范式优化的模型很难转移到另一种范式,这凸显了联合框架的必要性。我们提出了音频和语音 Transformer 表示的统一学习 (ULTRAS),其中掩蔽和预测建模是在长数据块上执行的。该模型基于 Transformer 架构,对 log-mel 频谱图特征的频谱补丁进行编码。使用组合损失函数对频谱和时间目标进行屏蔽片段的预测建模,迫使表示对时间和频率特征进行编码。对各种语音和音频任务进行了实验,我们证明 ULTRAS 框架比其他已建立的基线实现了更高的性能。