论文

RobustSpeechFlow:通过基于增强的对比流匹配学习鲁棒的文本到语音轨迹

RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching

模型训练预训练

摘要

虽然流匹配文本到语音 (TTS) 实现了强大的零样本说话者相似度和自然度,但它仍然容易受到内容保真度问题的影响,特别是由于不完美的对齐而导致的跳过和重复错误。我们提出了 RobustSpeechFlow,一种训练策略,通过使用保留长度的重复和跳过潜在增强来扩展对比流匹配,从而提高对齐鲁棒性。我们的方法不需要外部对准器或偏好数据,直接惩罚现实的故障模式,并很容易集成到现有的管道中。在 Seed-TTS-eval 上,它仅使用 0.06B 参数将字错误率 (WER) 从 1.44 降低到 1.38。在我们的 ZERO500 基准测试中,它在不同的说话者和韵律条件下提供了一致的清晰度改进;在 NFE=24 时,它将英语字符错误率 (CER) 从 0.48% 降低到 0.35%,韩语 CER 从 0.81% 降低到 0.57%。音频样本:https://robustspeechflow.github.io/