论文

语音优先国家的偏好:印度语言 TTS 的大规模成对评估和偏好分析

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

模型评测基准与评测资源

摘要

众包成对评估已成为评估基础模型的可扩展方法。然而,由于语言多样性和语音感知的多维性质,将其应用于文本到语音(TTS)会带来很大的方差。我们提出了一种用于多语言 TTS 的受控多维成对评估框架,该框架将语言控制与基于感知的注释相结合。我们使用 10 种印度语言中的 5K+ 本机和代码混合句子,评估了 7 个最先进的 TTS 系统,并从 1900 多名本机评估者那里收集了超过 120K 的成对比较。除了总体偏好外,评估者还提供 6 个感知维度的判断:可理解性、表现力、语音质量、生动性、噪音和幻觉。使用 Bradley-Terry 模型,我们构建了一个多语言排行榜,使用 SHAP 分析解释人类偏好,并分析排行榜可靠性以及模型优势和跨感知维度的权衡。