论文
文本转语音系统的特定领域评估:多指标基准研究
Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study
摘要
神经文本转语音 (TTS) 系统的最新进展极大地提高了多种语言的语音自然度和清晰度。然而,联合评估不同语音领域的感知质量、说话者相似性和声学保真度的综合评估方法仍然有限,特别是对于资源匮乏和代表性不足的语言。本文提出了一个可重复的多指标基准测试框架,用于通过特定领域的分析对现代 TTS 系统进行系统评估。所提出的框架集成了互补的主观和客观评估协议,并通过对跨越四个语音领域的代表性低资源语言的综合案例研究进行了论证:正式、会话、文学/讲故事和情感。使用 MUSHRA 听力测试、ABX 辨别测试、Resemblyzer 说话者相似度评分以及基于 960 个音频对的梅尔倒谱失真 (MCD) 和 F0 RMSE 的声学分析来评估四种最先进的 TTS 系统(Indic-Parler-TTS、MMS-TTS、Microsoft Edge TTS 和 Google Gemini TTS)。结果显示,不同语音领域的 TTS 性能存在显着差异,情感语音始终面临最大的合成挑战(平均 MCD 12.03 dB;平均 F0 RMSE 889 美分),而会话语音则实现了最高的整体音质。除了实证研究结果之外,这项工作还提供了一个可重复的评估框架,公开发布评估脚本、结果表和可执行的 Colab 笔记本,以支持标准化基准测试和未来对低资源语言 TTS 评估的研究。