论文
通过发音瓶颈增强病态言语
Enhancing Pathological Speech through Articulatory Bottlenecks
摘要
构音障碍语音重建 (DSR) 通常依赖于从受损语音中提取的语言或语音表示来生成更容易理解的波形。我们研究了一种补充方法,该方法干预与语音产生相关的表示。从神经分析合成框架开始,我们引入了一个残差映射器,它可以修改发音对齐的潜空间,同时保留说话者和韵律信息。映射器经过并行合成健康和人工构音障碍语音的预训练,然后使用音素引导和对抗性目标适应自然构音障碍语音。我们进一步将发音瓶颈与维度匹配的无监督表示进行比较,以评估显式发音监督的好处。