论文

知道要强调什么:话语条件下的文本转语音基准

Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark

模型评测基准与评测资源

摘要

口语意义往往不仅取决于所说的内容,还取决于所强调的词。同一个句子可以传达纠正、对比或澄清,具体取决于重点所在。尽管现代文本转语音 (TTS) 系统可以生成富有表现力的语音,但仍不清楚它们是否仅从话语中推断出上下文适当的重音。为了解决这一差距,我们提出了上下文感知重音 TTS (CAST),这是一个评估 TTS 中上下文条件词级重音的基准。项目被定义为对比上下文对:相同的句子与需要不同重读单词的不同上下文配对。我们评估了最先进的系统并发现了一致的差距:纯文本语言模型能够可靠地从上下文中恢复预期的压力,但 TTS 系统经常无法在语音中实现这一点。我们发布了基准、评估框架、构建管道和合成语料库,以支持未来的上下文感知语音合成工作。