论文

文本到语音系统的语音映射:基于度量的语音质量评估方法

Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment

模型评测评测方法与指标

摘要

本研究将语音映射作为文本转语音 (TTS) 合成质量的评估框架进行研究。该研究分析了六种 TTS 模型,包括历史模型和近期模型。这些指标包括波峰因数、频谱平衡和倒谱峰值突出度 (CPP)。我们研究了 6 个有影响力的 TTS 模型:Merlin、Tacotron 2、Transformer TTS、FastSpeech 2、Glow-TTS 和 VITS。结果表明,语音范围是模型能力的主要指标,其中 VITS 显示了测试模型中最大的范围。尽管语音范围有限,但 Glow-TTS 在轻柔发声方面表现出卓越的性能,这表现为较高的频谱平衡。结果表明,CPP 值在 7-8 dB 之间表示语音质量自然,而 CPP 超过 10 dB 时,语音听起来很机械。这些发现强调需要通过语音映射来评估声音效果,并捕获 TTS 系统如何处理语音动态和表现力。