论文
VoiceTTA:通过基于强化学习的测试时间适应增强零样本文本转语音
VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation
摘要
最近,零样本文本转语音(TTS)实现了高保真和富有表现力的语音合成,但它通常无法模仿不常见场景(例如串扰、方言)中未见过的说话风格。此外,微调 预训练模型需要大量高质量的数据集,限制了快速个性化。我们提出了 VoiceTTA,一种基于强化学习的测试时间适应 (TTA) 方法,可改进预训练的零样本 TTS 模型的语音模仿。 VoiceTTA 引入了两种基于 F0 和能量变异系数差异的风格奖励,并结合说话者相似性和可理解性(来自预训练 Whisper 模型的 WER),并在推理时通过基于流匹配的模型中的组相对偏好优化 (GRPO) 来优化可学习前缀。大量的实验表明,不常见的语音提示有了显着的改进,优于最先进的基线。音频样本可在 https://voicetta.pages.dev/ 获取