论文

生成口语模型中分段宽度和簇大小对语音再合成和延续的影响

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

模型评测模型能力评测

摘要

生成口语建模 (GSLM) 通过使用离散语音表示而不是文本转录来训练语言模型 (LM),从而实现无文本语音建模。在本文中,我们使用不同比特率的离散语音表示来研究 GSLM 在语音合成和延续方面的性能。我们以固定宽度分割语音表示,并以多个簇大小训练 K 均值模型,从而产生各种比特率设置。我们证明可以在比基线更低的比特率设置下合成可理解且自然的语音。此外,在多个指标中,语音连续质量在较低比特率下保持稳定,这表明传统的 GSLM 设置对于有效的语音生成可能是多余的。尽管与传统指标相比,基于 LLM 的指标与人类主观评分的相关性更高,但它仍然很低,这凸显了对更稳定的自动评估方法的需求。