论文
使用神经音频编解码器词元剖析自监督语音学习中训练语言的敏感性
Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens
摘要
神经音频编解码器 (NAC) 因获取离散标记的语音表示而变得流行。除了压缩之外,离散词元还可用于训练自我监督学习(SSL)模型。此类模型称为基于编解码器的 SSL 模型,可减少数据存储和计算成本,从而实现可扩展的 SSL 预训练。然而,他们的语言敏感性仍不清楚。当语言发生变化时,基于编解码器的 SSL 模型可能需要重新训练,这会降低其效率。在本文中,我们通过改变 NAC 训练语言或 SSL 预训练 语言,同时保持另一个固定,对语言敏感性进行系统分析。实验结果表明,下游性能对 NAC 训练语言不敏感,但强烈依赖于 SSL 预训练 语言。这些发现表明,单个 NAC 可以跨语言重用,而将 SSL 预训练 语言与目标语言保持一致至关重要。