论文

词汇声调难以量化:探究普通话和约鲁巴语中的离散语音单元

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

模型评测模型行为与机制分析

摘要

离散语音单元 (DSU) 是通过对使用自监督学习 (SSL) 训练的模型进行量化表示而得出的。它们是各种口语任务的流行表示,包括那些韵律很重要的任务。 DSU 对于文本和语音联合建模的任务特别方便,例如文本到语音和多模态对话系统。但我们发现 DSU 编码超音段信息的可靠性不如音段结构,我们在这项工作中使用词汇声调演示了这一点,尽管这种限制可能会扩展到其他超音段特征,例如韵律。我们使用普通话和约鲁巴语声调语言进行的调查表明,SSL 潜在表示本身确实对声调进行编码,但使用量化获得的 DSU 倾向于优先考虑语音结构,这使得词汇声调的编码不太可靠。这对于各种量化方法都是如此,而不仅仅是最常见的 K 均值。我们得出的结论是,当前的 DSU 量化策略对于超分段特征存在局限性,这表明在语音表示学习中需要新的音调感知(或韵律感知)技术。我们通过执行一次 K 均值聚类来编码语音信息,然后再次执行残差表示来指出解决方案的潜在形式,这可以更好地编码词汇语气。