论文
InsideSSL:从模型内部理解自监督语音表征
InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective
摘要
自监督学习 (SSL) 模型,例如 Wav2Vec2、HuBERT 和 WavLM,已成为各种语音和音频任务的基础。尽管取得了成功,但了解其内部分层动态仍然是一个持续的挑战。为了解决这个问题,我们提出了一个由两部分组成的以模型为中心的框架,称为 InsideSSL。首先,我们从三个内在的每层角度建立与任务无关的分析:压缩(熵)、几何(曲率)和对扰动的鲁棒性。我们表明,不同的训练目标会导致不同的声学压缩和流形展开机制。其次,我们引入跨层生成兼容性矩阵(GCM)来评估功能可迁移性、暴露稳定的语音核心、身份波动性和深层语义修剪。除了这些评估之外,线性探测还将以模型为中心的视角连接到下游任务,演示层拓扑如何决定音素、音高和说话人编码。