论文
超越自然:在语言基础维度上探索自动文本到语音评估器
Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
摘要
自动文本转语音 (TTS) 评估方法(平均意见得分 (MOS) 预测器和音频 大语言模型 (Audio-LLM) 判断器)预计能够反映人类的感知,但尚不清楚它们如何很好地捕捉听众实际感知的语音的不同方面。我们将“自然性”解构为跨越 10 个不同感知维度的基于语言的注释模式,并使用它构建 TTS 的第一个维度级元评估基准,其中包括由训练有素的语言学家评分者注释的 860 个话语。对四个 MOS 预测器和四个 Audio-LLM 判断器进行基准测试的结果表明,MOS 预测器会崩溃到声学信号质量,而 Audio-LLM 判断器则显示出选择性的、依赖于提示的检测,该检测不能在所有维度上推广。这两类都不能可靠地捕获大量语言结构的语音错误。我们的数据集、注释模式和评估代码都是公开发布的,以支持更有针对性和可解释性的 TTS 评估。