论文

低资源多语言文本转语音的复杂文本鲁棒性评估和故障诊断

Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech

模型评测鲁棒性、公平性与可信度评测

摘要

资源匮乏的多语言文本转语音 (TTS) 系统扩大了语言覆盖范围,但其在复杂文本输入下的鲁棒性仍未得到充分诊断。现有的评估主要侧重于使用常规测试句子的自然性、说话者相似性和内容一致性,而对多语言 TTS 系统在处理数字、日期、命名实体、长句子、代码转换表达式和标点符号相关结构等具有挑战性的输入时如何失败的了解有限。本文提出了一种针对低资源多语言 TTS 的复杂文本鲁棒性诊断框架。我们从三个维度评估鲁棒性:内容一致性、语言一致性和生成稳定性。针对泰语、越南语、斯瓦希里语、印尼语设计了多语言鲁棒性测试方案,涵盖普通句子和多种类型的复杂文本输入。我们进一步引入自动诊断指标,包括字符错误率、语言识别准确率和持续时间异常率。为了支持语音生成之前的输入级风险分析,我们提出了一种轻量级文本风险评分(TRS),它可以根据可解释的文本特征估计合成风险,而无需手动注释或 模型训练。对 OmniVoice、VoxCPM2 和 MMS-TTS 等三种代表性多语言 TTS 系统的实验表明,复杂的文本输入会暴露出普通短句评估无法完全反映的系统故障模式。不同的系统在数字规范化、命名实体处理、长文本生成和代码交换输入处理方面表现出明显的漏洞。此外,TRS 与内容错误和持续时间异常呈正相关,证明了其作为低资源多语言 TTS 中复杂文本风险诊断的低成本预合成指标的有用性。