论文
SepRQ:通过无掩模、多尺度源分离进行自监督语音混合表示学习
SepRQ : Self-Supervised Speech Mixture Representation Learning via Mask-Free, Multi-Scale Source Separation
摘要
自监督学习 (SSL) 是语音表示学习的标准,但主流模型是围绕单扬声器音频设计的,限制了它们在多扬声器场景中的实用性。我们提出了 SepRQ,一个开源 SSL 框架,它用冻结随机投影码本上的伪源分离目标取代了屏蔽预测。通过采用新颖的无掩模、多分辨率方法,SepRQ 在 SUPERB 基准上实现了说话人二值化和语音分离方面最先进的性能,在基本和大规模上都超越了 WavLM 和其他鸡尾酒会派生的 SSL,同时仅需要 85.68M 推理参数。 SepRQ 还在需要注册的目标说话人任务(例如目标说话人自动语音识别)以及具有挑战性的多域 DIHARD 3 二值化数据集上展示了强大的性能。值得注意的是,我们报告了三扬声器混合 (WSJ0-3Mix) 的强大分离能力,而当前的 SSL 文献在这方面表现不佳。虽然鸡尾酒会 SSL 仍然稀缺且闭源,仅限于 C-HuBERT 和基于注册的 SA-WavLM,但我们向社区开源 SepRQ。
