论文
基于自动编码器的优化 SSL 表示:复杂性最小化和改进构音障碍 ASR
Autoencoder based optimized SSL representations: Complexity Minimization and improved Dysarthric ASR
摘要
自监督学习 (SSL) 模型可提取丰富的语音表示,但通常具有高维特征,从而增加了计算复杂性。这项工作探索了一种 SSL 自动编码器 (SSL-AE) 瓶颈方法,可有效减少特征维度,同时保持构音障碍的自动语音识别 (ASR) 性能。通过利用自动编码器,我们将高维 SSL 特征转换为紧凑的空间,从而降低了模型复杂性和训练时间。我们的方法保留了基本的语音信息,降低了单词错误率 (WER),同时显着降低了计算成本。实验表明,与 SSL 基线相比,SSL-AE 瓶颈将训练时间缩短了 8 倍,在不牺牲识别性能的情况下展示了效率。这些结果突出表明 AE 是资源受限环境中 SSL 特征压缩的有效解决方案。