论文
通过语音基础模型的介入 后训练 学习特定任务子空间
Learning task-specific subspaces via interventional post-training of speech foundation models
摘要
语音基础模型在未标记语音数据的大型语料库上进行了预训练,可生成跨任务有用的通用表示。然而,这些表示以分布式方式编码有关显着语音变量的信息,而下游语音任务仅依赖于其中的一些可变性。在这项工作中,我们提出了一种使用介入对比学习的 后训练 细化方法。通过利用介入数据集和多部分对比损失,我们学习了从语音基础模型的纠缠表示空间到单独的内容和说话者子空间的转换。我们评估了说话人验证和关键词识别任务中学习到的表示,显示出改进的域外说话人验证性能,并证明说话人和内容信息在学习的子空间中是分开的。