论文

SARA:通过集成语义和声学表示来生成高保真语音的双流 VAE

SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations

应用与实践内容创作

摘要

零样本文本转语音 (TTS) 依赖于强大的语音表示。然而,当前的语音标记器面临着一个基本的权衡:声学编解码器保留高保真音频,但缺乏语言限制,导致生成过程中出现内容错误,而来自自监督学习(SSL)模型的语义标记可确保精确的文本对齐,但会丢弃一些声学信息。为了弥补这一差距,我们提出了 SARA,这是一种双流 VAE,它直接将冻结的 SSL 语义锚与专用的残余声学编码器融合。这有效地缓解了困境,在不依赖复杂正则化器的情况下创建了高效且紧凑的潜在空间。 SARA 实现了优于强基线的重建质量。此外,在下游零样本 TTS 任务中,它可以产生高度自然和富有表现力的合成质量,即使在加速推理下也能保持强大的生成性能,从而在合成速度和计算成本之间提供有利的权衡。