论文
SemBridge:用于连续潜在自回归语音生成的语义标记锚定
SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation
摘要
通过避免量化损失并保留更丰富的声学信息,连续潜在自回归语音生成已成为离散词元建模的有前途的替代方案。然而,连续声学目标不会将语言结构暴露为明确的 词元级 预测目标。因此,自回归语言模型(LM)必须通过声学预测间接获取语言结构,这可能会损害生成语音的内容保真度。我们提出了 SemBridge,一种用于连续潜在自回归语音生成的仅训练语义标记锚定框架。 SemBridge 使用离散语义标记来直接监督自回归 LM 状态,并采用语义对齐声学 VAE 在相同语义参考下组织连续目标空间。语义监督仅在训练期间使用,而推理保持完全连续。我们在零样本文本转语音(TTS)和分数条件歌声合成(SVS)方面评估 SemBridge。在多个基准测试中,SemBridge 提高了内容准确性(通过单词和字符错误率 (WER/CER) 衡量),同时保持了竞争者的相似性和感知质量。实验结果表明,自回归状态学习的显式语义标记监督是连续语音生成的有效且通用的方向。提供语音样本。1 模型代码和检查点将在 https://github.com/ASLP-lab/SemBridge 上提供