论文

解释因式分解的自我监督子空间中的内容和说话者特征

Interpreting Content and Speaker Characteristics in Factorised Self-Supervised Subspaces

模型评测模型行为与机制分析

摘要

自监督语音特征对内容和说话者信息进行编码。最近的工作引入了基于 SVD 的分解,将这些特征分解为捕获时间变化的共享内容矩阵和捕获静态说话者特征的特定于说话者的转换。然而,这些组件中的信息如何组织仍不清楚。在本文中,我们研究了 WavLM 因子化内容和说话者子空间的维度如何与音调、强度和发声等语音特征相关。我们发现内容空间中的前导维度主要捕获强度、高阶共振峰和发声,而音高则在后面的维度中进行编码。相比之下,方差最大的说话人尺寸与音高和性别密切相关,后面的尺寸捕获高频变化。干预实验表明,操纵这些维度可以有针对性地控制语音合成的语音特征。此外,联合修改内容和说话者表示可以提供对音调和强度等特性的细粒度控制。