论文
通过语音激活映射进行电话分割和识别
Phone Segmentation and Recognition through Phonological Activation Mapping
摘要
电话分割和识别本质上是相关的任务,但现代方法通常对它们进行单独建模。我们认为,语音结构已经隐藏在自监督语音模型(S3M)的表示中,人们只需要引导它们来解决这两项任务。我们利用基于 S3M 的语音激活映射 (SPAM),它将每个 S3M 表示帧映射到语音特征激活向量,例如发声和鼻音。在SPAM之上,我们引入了两个简单但有效的轻量级、无梯度下降的预测头:识别头和分割头。我们的方法需要不到一分钟的语音转录,并且可以推广到训练期间看不见的电话。在各种数据集上,我们的方法获得了强大的分割和识别性能。