论文
剩下的就是内容:来自并行话语的不变语音标记化
Content is What Remains: Invariant Speech Tokenization from Parallel Utterances
摘要
离散语音标记器旨在将语义与声学信息分开,但 HuBERT 等自监督学习 (SSL) 模型的目标保留了非语言变异:说话者身份、韵律和通道条件泄漏到标记中,导致熵膨胀。我们的主要见解是,当足够多的说话者在不同条件下说出相同的单词时,语言内容是唯一的共享因素。我们提出了 PINT(并行不变标记化),它通过并行话语和增强之间的对齐损失来微调 SSL 编码器,以提取此共享残差。 PINT 将相同的单词折叠到一致的标记序列上,从而大大减少条件熵。与 ASR 文本不同,PINT 词元保留帧级时间基础,并充当音频编解码器的嵌入式语义目标。实验表明,与基线相比,说话人探测准确度相对降低了 98.7%(93.1% 至 1.2%),ABX 错误率降低了 42%,LM 困惑度降低了 27-30%,这证实了正确的不变性是高效学习的关键。