论文
TTS-PRISM:用于细粒度诊断的感知推理和可解释语音模型
TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
摘要
虽然生成式文本转语音 (TTS) 模型接近人类水平的质量,但单一指标无法诊断细粒度的声学伪影或解释感知崩溃。为了解决这个问题,我们提出了 TTS-PRISM,一个普通话的多维诊断框架。首先,我们建立了一个涵盖稳定性和高级表现力的 12 维模式。其次,我们设计了一个具有对抗性扰动和专家锚的有针对性的合成管道,以构建高质量的诊断数据集。第三,模式驱动的指令调整将明确的评分标准和推理嵌入到高效的端到端模型中。在 1,600 个样本专家标注测试集上进行的实验表明,TTS-PRISM 在人类对齐方面优于通用模型。分析六种 TTS 范例可以建立直观的诊断标志,揭示细粒度的能力差异。 TTS-PRISM 是开源的,代码和检查点位于 https://github.com/xiaomi-research/tts-prism。