论文

用于音节标记化的说话者解缠分块回归

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

摘要

无监督音节标记化旨在学习离散音节标记,从原始语音中捕获潜在的语言内容相关结构。最近的音节标记化方法采用预训练 HuBERT 的师生 蒸馏 将潜在语音帧表示组织成音节段。然而,当使用话语级交叉熵目标进行训练时,该模型预测说话者身份而不是语言内容,从而损害了音节标记的纯度。为了解决这个问题,我们提出了一种与说话人分离的音节分词器,它将受说话人扰动的学生表示回归到固定长度块内的干净教师目标。实验结果表明,我们提出的方法在音节边界检测和音节段聚类方面实现了最先进的性能。此外,基于我们的音节标记训练的语音语言模型在句法和语义理解方面比音素级 SpiRit-LM 提高了 7%。