论文
如何利用基于 LLM 的 ASR 系统的合成语音?
How to Leverage Synthetic Speech for LLM-Based ASR Systems?
摘要
在银行和医疗保健等受监管领域,隐私限制导致收集和保留真实语音的成本很高,现代文本转语音 (TTS) 的合成语音是训练自动语音识别 (ASR) 的一种有吸引力的替代方案,而且不会暴露敏感的客户录音。然而,合成数据和真实数据之间持续存在的分配差距限制了它取代真实记录的程度。之前的工作主要将这一差距视为需要围绕其设计的黑匣子,但在我们的工作中,我们通过探测 SLAM-ASR 架构来直接检查其起源。然后,我们定位其 LLM 主干将真实语音与合成语音分开的位置,并发现区分信号集中在早期到中间层,其中时间和韵律扰动对它的干扰最大。我们进一步表明,表示级别的可分离性有帮助,但不能直接预测下游 ASR 收益。另一方面,将合成音频与房间脉冲响应 (RIR) 进行卷积缩小差距不是通过使合成语音听起来更干净或更自然,而是通过再现真实录音的声学不规则性。将这些发现转化为训练过程,通过添加层选择模块并结合 RIR 增强,仅使用 25% 的真实语音(13.6 小时)即可匹配完全真实的数据基线,并在所有更高的比例上超越它。