论文

GLaS-JEPA:没有工程预测目标的高斯正则化语音 SSL

GLaS-JEPA: Gaussian-Regularized Speech SSL without Engineered Prediction Targets

模型训练预训练

摘要

语音自监督学习旨在学习下游语音任务的通用表示。然而,当前的方法依赖于复杂的、精心设计的预测目标。我们通过 GLaS-JEPA 挑战这种必要性,该框架可以直接预测当前编码器在屏蔽位置的连续表示,无需对比学习、离散目标或单独的 EMA 目标编码器。我们使用 SIGReg 表示空间正则化来防止表示崩溃,从而消除了对工程目标生成机制的需要。经过 960 小时的 LibriSpeech 预训练,我们的 57M 参数模型在冻结编码器 SUPERB ASR 上实现了 6.89% 的 WER,在槽填充上实现了 25.87% CER,分别比最佳非蒸馏低于 90M 基线高出 43.1% 和 22.0%。这些结果表明,从根本上简化的训练方案中可以产生高度竞争性的语音表示。