论文

并行时带混合与学习观察相加,实现稳健的 ASR 前端

Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends

应用与实践语音识别与转写

摘要

语音增强通常用作稳健 ASR 的前端,但循环时间和跨频带模块引入了顺序依赖性,从而降低了并行效率。在本文中,我们提出了一个基于并行时带混合器(PTBM)块构建的序列并行带分割增强前端,该前端消除了块内循环展开。 PTBM 将带内时间混合和每帧跨带注意力集成在统一的并行架构中,从而实现跨时间和频率维度的高效上下文建模。该系统保留了掩模加残差重建接口,并引入了学习观察添加(LOA)来抑制 ASR 敏感伪影,而无需开发集调整。在带有冻结 Whisper 后端的 DNS Challenge 和 CHiME-4 上进行的实验表明,所提出的前端相对于循环带分割基线持续降低了字错误率,同时前端网络仅需要 0.96 M 参数和 0.58 GMAC/s。