论文

ReLMCodec:根据预量化音素结构设计可预测的语音标记

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

应用与实践内容创作

摘要

神经语音编解码器在语言模型时代面临着根本性的紧张:支持高保真重建的标记不一定容易被自回归模型预测。我们对不同编解码器和自监督语音表示的受控分析表明,离散代码分配之前更清晰的音素结构始终与更容易的自回归标记预测相关。然而,单独的音素结构不足以进行高保真重建,这还需要与重建相关的声学细节。在此观察的指导下,我们引入了 ReLMCodec,这是一种基于保留-控制-细化原则的低比特率单码本语音编解码器:它在量化器输入处保留冻结自监督学习(SSL)特征的语言组织,通过预量化锚点保留适应(PAPA)控制重建驱动的漂移,并使用仅训练的 WavLM-Large L24 教师细化量化的潜在空间,以减少音素级标记碎片。这些组件一起允许声学细节支持波形重建,同时保持生成的标记序列对于自回归模型是可预测的。在 650 和 800 bps 下,ReLMCodec 移动了我们评估中的经验单流可预测性重建前沿,并在清晰度和说话者相似性方面将增益转移到下游文本到语音 (TTS) 合成。