论文
连接自监督学习和语音增强:Wav2Vec2 条件框架
Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework
摘要
扩散模型显示出语音增强的潜力,但缺乏语言指导。我们根据来自噪声输入的 wav2vec 2.0 特征来调节基于扩散的模型,通过特征线性调制 (FiLM) 在 U-Net 瓶颈处注入。来自退化语音的 wav2vec 2.0 特征的语音表示锚定了反向扩散过程。当冻结的 wav2vec 2.0 编码器提取特征时,学习的 FiLM 生成器会生成比例和移位参数,以最小的开销调节瓶颈。在线性高斯状态空间模型下的最佳贝叶斯因果估计器的推动下,FiLM 系数通过指数平滑进行聚合以进行时间压缩。对 VoiceBank-DEMAND 和 LibriMix 的评估显示了与 PESQ、STOI、SI-SDR 和 DNSMOS 中无条件基线相比的竞争性能。我们一致记录 PESQ 得分提高了 0.4,这表明自我监督表征有效地调节了基于扩散的语音增强。