论文

使用路由稀疏自动编码器解开语言和副语言信息

Disentangling Linguistic and Paralinguistic Information with Routed Sparse Autoencoders

模型评测模型行为与机制分析

摘要

自监督语音编码器在共享的、纠缠的表示空间中包含语言和副语言信息。我们将 TopK 稀疏自动编码器与特定于路线的监督和跨因素对手结合起来。在冻结的 SPEAR 和 WavLM 编码器中,独立探针显示了特定因素的保留和抑制:语言信息在语言途径中仍然更强,而副语言因素,包括说话者身份、情感和韵律,在副语言途径中保留,并在语言途径中大幅减少。在 LibriSpeech 上学习到的路由组织会保留在 MSP-Podcast 上,而无需表示端重新训练。特征空间路线干预进一步转移交换的因子,同时在很大程度上保留未改变的路线携带的信息。这些结果显示了编码器、语料库、独立探针和表征级干预之间一致的路径选择性分离。