论文
自然总是合适的吗?研究不同领域的自然性和适当性以进行 TTS 评估
Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
摘要
文本转语音 (TTS) 评估是一项公开的挑战。虽然主要目标是“自然性”,但最近保真度的提高将焦点转向“适当性”以及语音是否适合其上下文。在这项工作中,我们研究了当预期下游用途发生变化时感知如何变化。我们测量了跨五个领域的五个 SOTA TTS 系统的适当性和人类相似性:人工智能助手、阅读器、演员、动画角色和自发演讲者。结果表明,不同领域的适当性有所不同,与自然性无关。虽然系统在阅读方面表现出色,但表达领域仍然具有挑战性,针对某一领域的优化可能会降低其他领域的水平。此外,自然度分数往往会惩罚程式化的演讲,而奖励自发性。最后,我们的研究还强调了更具表现力领域中一刀切的评估指标中的盲点。我们证明 TTS 性能并未“解决”,而是取决于目标域,需要上下文感知评估。