论文

S-JEPA:用于自监督语音表示学习的软聚类锚

S-JEPA : Soft Clustering Anchors for Self-Supervised Speech Representation Learning

模型训练预训练

摘要

自监督语音编码器主要通过预测屏蔽位置处的离散硬簇 ID 来进行训练,这种方法可以消除类别边界处的声学模糊性,并且需要中断训练以在迭代之间重新聚类整个语料库。我们引入了 S-JEPA,这是一个 JEPA 风格的编码器-预测器对,经过训练,可以通过 KL 散度在屏蔽位置匹配高斯混合模型的软后验。训练作为一个连续优化轨迹分两个阶段运行:基于 MFCC 特征的固定 GMM,然后是基于编码器特征的在线 GMM,从无标签信号中自适应选择输入层,消除离线重新聚类步骤和手动调整选择要聚类的 Transformer 层。在 SUPERB 协议下,S-JEPA 在评估的 90M 参数以下的 SSL 方法中实现了最低的 WER,并在大约一半的参数数量上与 HuBERT-Base 的情感识别相匹配,建立了新的 Pareto 前沿,无需离线重新聚类或教师 蒸馏。对保留语音的预测器每帧熵的分析揭示了一种双峰分布,其中绝大多数帧接近完美的二簇关系的熵,这提供了直接的经验证据,表明软目标目标保留了硬目标将崩溃的声学模糊性。代码可在 https://github.com/gioannides/s-jepa 获取。