论文
JASPER:联合音频和语音预训练编码器表示
JASPER: Joint Audio and Speech Pre-trained Encoder Representations
摘要
语音和音频的自监督学习(SSL)在很大程度上沿着不同的轨道发展:语音模型强调时域预测,而音频表示学习则侧重于时频模式。这种分离造成了兼容性差距,限制了跨域泛化。在这项工作中,我们介绍了 JASPER(联合音频和语音预训练编码器表示),这是一个通过时频目标增强语音预训练模型的框架。具体来说,JASPER 对长音频片段执行时间和频谱目标的屏蔽预测,从而实现语音和音频信号的频谱时间表示学习。所提出的方法在不同的语音、音频和音乐任务上始终优于多个基线和现有的语音/音频编码器,证明了统一谱时建模的有效性。