论文

在统一生成框架中比较语音内容表示

A Comprehensive Study of Content Representations for Speech Synthesis

模型评测模型行为与机制分析

摘要

语音内容表示对于语音转换、语音到语音翻译和多模态语言模型至关重要,但很少在直接测量每个表示所包含内容的通用生成框架下对它们进行比较。我们通过训练仅以每种表示为条件的生成模型并沿着内容、说话者身份和韵律轴评估生成的音频来解决这个问题。在 SSL 特征、监督词元、后验图和神经音频编解码器中,我们发现了两种不同的机制:几乎重建原始音频的表示,以及有效解耦说话者身份的表示。这些结果表明,解耦不仅取决于监督,还取决于训练目标和表示的信息容量之间的相互作用:监督表示仅在其容量受到充分限制时才能解耦说话者身份。

以统一解码与声码器框架比较语音表示的内容、说话人和音高属性。
图1(图注摘要):以统一解码与声码器框架比较语音表示的内容、说话人和音高属性。